{"as_of":"2026-08-07T08:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:114bca550cffa4d9830515c944de3deaa9102dbd0611c1bd8588109ec389681f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:31:07.755855Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T12:35:48.973163Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T12:32:09.940698Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/1907.00456"},"observation_digest":"sha256:a5d3e744f9b064963eada79a08944105b46abb1dc0130e2aa6a053c55dde01a8","observation_id":"63b06953-ea16-4a6a-964a-e3a3380b921a","resolution":{"observed_at":"2026-05-25T12:35:48.976218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T15:19:21.367628Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/1911.11361"},"observation_digest":"sha256:899e1151d09d5058fe2ed1cfc73f683ce5e632f9b200509ddc5199ef46168c94","observation_id":"b6b042a1-08d5-4666-8bde-5a1126682347","resolution":{"observed_at":"2026-05-13T15:19:21.423129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T23:19:17.322890Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2004.07219"},"observation_digest":"sha256:cc8b59593f8c94d79e875943a8a25238ca40c82c6543c73ed902295213d45fa6","observation_id":"22f1d582-6358-4ddc-9f69-86b106be883b","resolution":{"observed_at":"2026-05-12T23:19:17.409114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:81daa0e6ba5fbe6f2880cca4c3b1858d29ac82f298b2a6f1c18c678c85c3f878","observation_id":"22bd0f83-d64b-421f-b16c-3c9cff3ce925","resolution":{"observed_at":"2026-05-11T11:33:21.574462Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2412.02818","last_updated":"2026-05-18T18:24:46Z","snapshot_observed_at":"2026-07-06T20:01:14.493111Z","submitted_at":"2024-12-03T20:34:51Z","title":"RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-23T07:49:37.878395Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2412.02818"},"observation_digest":"sha256:55585c5d99fe59da3a35f2b57fc6354aba341f9ba4d1a547a8447a205d2cc2fe","observation_id":"cffc500b-6e73-442a-b4dd-fe35a2b93c91","resolution":{"observed_at":"2026-05-23T07:52:43.880492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-06T20:31:07.755855Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02712","last_updated":"2025-07-03T15:26:48Z","snapshot_observed_at":"2026-08-06T20:20:16.400675Z","submitted_at":"2025-07-03T15:26:48Z","title":"A Forget-and-Grow Strategy for Deep Reinforcement Learning Scaling in Continuous Control","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:31:07.755855Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2507.02712"},"observation_digest":"sha256:da5ce7a9da29edd5dac8813675d70e3835df925fcf5a72be4f217ebe292a6fef","observation_id":"a01e27ca-ae96-4cf7-8ea7-ad628b92dfc6","resolution":{"observed_at":"2026-08-06T20:31:07.755855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2509.19538","last_updated":"2026-05-13T08:29:03Z","snapshot_observed_at":"2026-07-06T22:30:36.671861Z","submitted_at":"2025-09-23T20:06:26Z","title":"DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T13:55:16.513839Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2509.19538"},"observation_digest":"sha256:b4f494ef7bdcccae6a34c1555d6840d7dd8c3fba42842b1a9818bc106cacfaa3","observation_id":"d72888b8-ee2f-42b6-bb8d-62f8603480b2","resolution":{"observed_at":"2026-05-18T13:56:26.092270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2604.21209","last_updated":"2026-04-23T02:01:37Z","snapshot_observed_at":"2026-07-06T23:07:51.979267Z","submitted_at":"2026-04-23T02:01:37Z","title":"Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T22:40:31.084594Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2604.21209"},"observation_digest":"sha256:d783a46c43150a0b2190baf132f6d8dad4ad427b77efb52d0043eae7501434cb","observation_id":"59543e8c-047a-4967-8190-805e0c333707","resolution":{"observed_at":"2026-05-09T22:44:14.995302Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T02:32:16.746824Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:dc215bb21da89e0c0b0a1c4f82e4d9db9c15995585cd25b2d7936ec1b119cdab","observation_id":"205f6cf7-2b43-4d79-bc0c-0164ad81ea66","resolution":{"observed_at":"2026-05-13T02:37:08.190747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":"1812.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy deep reinforcement learning without explo- ration","venue":null,"work_id":"7b042caa-e72b-431c-a209-86fee6e3d470","year":2018},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T08:53:29.468764Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:13199ee85c80af53564a71a3b6b45621eacc5da85809e0245205939354ba2c7b","observation_id":"fb0b81a7-af25-4529-8e26-ec16c1db2bcb","resolution":{"observed_at":"2026-05-21T08:54:05.798839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-01T13:15:11.461088Z","title":"Fujimoto, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19199","last_updated":"2026-07-21T15:34:06Z","snapshot_observed_at":"2026-08-06T23:00:53.451246Z","submitted_at":"2026-07-21T15:34:06Z","title":"Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:15:11.461088Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2607.19199"},"observation_digest":"sha256:4f080a17dc83402314d1e16eda9f5a6748afe4d4c56c23bfe3ee9613cff5b31a","observation_id":"2c6f62e2-ea4c-4def-abbd-e319c799d8e8","resolution":{"observed_at":"2026-08-01T13:15:11.461088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-07-30T11:06:22.520577Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-07T08:12:20.216217Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:22.520577Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:c7b26707f4c009836b9f80450f9a4068000625ca187e61bafc6d84f11cee87ba","observation_id":"6416329b-4cb6-43ff-b08c-718c17b387b5","resolution":{"observed_at":"2026-07-30T11:06:22.520577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-05T04:27:43.878960Z","title":"Off-policy deep reinforcement learning without exploration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-07T08:12:20.216217Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.878960Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:552ba2570f96bfbda01c69b136cfc9178798755b54f96f3083308f276ecda3fc","observation_id":"db5f9166-ea8d-42c8-b127-c020905a6e98","resolution":{"observed_at":"2026-08-05T04:27:43.878960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-07-31T01:24:20.486289Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27422","last_updated":"2026-07-29T19:43:40Z","snapshot_observed_at":"2026-08-04T18:59:28.394917Z","submitted_at":"2026-07-29T19:43:40Z","title":"Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T01:24:20.486289Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2607.27422"},"observation_digest":"sha256:5e945aab2400b95a0f4d180479bdcd00122a4eaa0667af4de89149814e36d033","observation_id":"e20d9cb9-f75b-4cdc-9654-9a97e46cb8fc","resolution":{"observed_at":"2026-07-31T01:24:20.486289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02900","snapshot_observed_at":"2026-08-04T19:45:30.241728Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-06T23:33:18.970298Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:30.241728Z"},"links":{"cited_paper":"/paper/1812.02900","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:05c4f72963689a6141c09ef428b1c5a72090c61f2946024efd57d439ceb07f16","observation_id":"9d55c0f0-601a-4975-94d9-2cc4805c1d1b","resolution":{"observed_at":"2026-08-04T19:45:30.241728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1812.02900/citation-record","integrity":"/paper/1812.02900/integrity","json":"/paper/1812.02900/citation-record.json","paper":"/paper/1812.02900"},"outbound":[],"paper":{"arxiv_id":"1812.02900","last_updated":"2019-08-10T03:36:31Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T07:19:45.696706Z","submitted_at":"2018-12-07T04:03:25Z","title":"Off-Policy Deep Reinforcement Learning without Exploration"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:1812.02900."}