{"as_of":"2026-08-05T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3e78116df664443a5e61787615dc42704bba990a96b62011b326a339f3b3a88","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:45:34.852244Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":537,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T08:51:55.826747Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2108.03298"},"observation_digest":"sha256:32e946e3cba21f5aba1bd1084a69ddaec3f9f9512d31844cc884b21e9eeeabbd","observation_id":"798f5a8b-a8f1-46a2-afda-7e554d96674b","resolution":{"observed_at":"2026-05-13T08:51:55.904631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T08:47:05.621624Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2110.06169"},"observation_digest":"sha256:baa2b1d107710a3c5899518d18cd696fef30b260db9c9f5525a15d8c4954a756","observation_id":"114f4217-f920-4a89-86b6-529d4ba6016a","resolution":{"observed_at":"2026-05-12T08:47:05.661694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2509.19538","last_updated":"2026-05-13T08:29:03Z","snapshot_observed_at":"2026-07-06T22:30:36.671861Z","submitted_at":"2025-09-23T20:06:26Z","title":"DAWM: Diffusion Action World Models for Offline Reinforcement Learning via Action-Inferred Transitions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T13:55:16.513839Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2509.19538"},"observation_digest":"sha256:fb178f99f3bd3dafd3bdacc7004a7c1ede03816d654c3b595793708334ee9fb2","observation_id":"918ed758-8c20-49ea-bc32-31db1ae7d66e","resolution":{"observed_at":"2026-05-18T13:56:26.127974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-04T11:01:31.063875Z","title":"Conservative q-learning for offline reinforcement learning, 2020 b","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:31.063875Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:6c1710db3ccbfebc7647226a216542da08bbac106eed5a28725ee6695624c494","observation_id":"e8e4e2d1-bdee-42ff-b814-21d6f5458937","resolution":{"observed_at":"2026-08-04T11:01:31.063875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2512.03847","last_updated":"2026-05-06T14:15:19Z","snapshot_observed_at":"2026-08-03T04:49:11.537109Z","submitted_at":"2025-12-03T14:48:38Z","title":"DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T01:46:21.744857Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2512.03847"},"observation_digest":"sha256:3d4ed53620d45f99c9ce23dcc95fc2415b3671aa0939b7856ba488da5f7b9465","observation_id":"593a8806-a6e6-448e-b68c-492efa911c48","resolution":{"observed_at":"2026-05-17T01:48:51.003494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2602.06603","last_updated":"2026-04-29T10:13:20Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T11:02:06Z","title":"The hidden risks of temporal resampling in clinical reinforcement learning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T07:05:16.379996Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2602.06603"},"observation_digest":"sha256:12872d4257bfe50344371f2420e644aef5bb9646c2512b891167e166b2be0730","observation_id":"18072b28-e076-4023-97dd-5c4a920c8b40","resolution":{"observed_at":"2026-05-16T07:07:29.616897Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2603.15759","last_updated":"2026-05-12T15:04:33Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T18:00:23Z","title":"Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:03.333757Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2603.15759"},"observation_digest":"sha256:e68d8924a4634863028183f2f27c795d6dc28d0e5ef24512c84df5d8968b5743","observation_id":"df39f09e-07b6-4ef8-8e75-5515c23b8209","resolution":{"observed_at":"2026-05-15T09:49:54.486151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2604.05845","last_updated":"2026-07-21T08:51:57Z","snapshot_observed_at":"2026-08-02T16:46:53.052715Z","submitted_at":"2026-04-07T13:11:12Z","title":"JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:01.560145Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2604.05845"},"observation_digest":"sha256:c75d5f82925fdff434d8bee31a5ebdaf382caa1c65cc6e6c9ee2d86adcbf233f","observation_id":"771a535d-9a5a-41fb-b930-f2cd098e19ff","resolution":{"observed_at":"2026-05-11T00:10:52.115427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-02T16:46:55.806545Z","title":"Tucker, and Sergey Levine","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2604.05845","last_updated":"2026-07-21T08:51:57Z","snapshot_observed_at":"2026-08-02T16:46:53.052715Z","submitted_at":"2026-04-07T13:11:12Z","title":"JD-BP: A Joint-Decision Generative Framework for Auto-Bidding and Pricing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T16:46:55.806545Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2604.05845"},"observation_digest":"sha256:b32cbcc354723467b67ae4faa6eff7a2398de526dfcc6a2f6e8bb48b1e6b18c0","observation_id":"13352aff-ad43-46fa-9169-02517c493e7d","resolution":{"observed_at":"2026-08-02T16:46:55.806545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.01567","last_updated":"2026-05-02T18:37:36Z","snapshot_observed_at":"2026-07-06T23:14:47.444386Z","submitted_at":"2026-05-02T18:37:36Z","title":"Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T13:59:40.638085Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.01567"},"observation_digest":"sha256:c4d336c7373f3b7073052f5772e835870a22fb16ba7dcee987515533b55ffcbb","observation_id":"9aeb8997-d922-4e50-aa27-2de53b38dbee","resolution":{"observed_at":"2026-05-09T22:29:06.408108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.02112","last_updated":"2026-05-04T00:22:21Z","snapshot_observed_at":"2026-08-02T05:50:52.770878Z","submitted_at":"2026-05-04T00:22:21Z","title":"An adaptive variance estimator for relative sparsity","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-08T19:35:46.097113Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.02112"},"observation_digest":"sha256:49284adc21de0107d8e86ec9dffcf91b423c1c1d34e8c3a6b34fdb28a21c3823","observation_id":"f1446329-990b-4a11-bbe1-7ec26ce075f7","resolution":{"observed_at":"2026-05-09T05:45:22.591920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T02:32:16.746824Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:775900802de6d25ee7612b780a185966147258dfe1ac36094adf8b3c83a125f7","observation_id":"54b2b2da-a21f-40ea-bfd8-cebf495def48","resolution":{"observed_at":"2026-05-13T02:37:08.274944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.11151","last_updated":"2026-05-20T06:10:49Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T18:58:49Z","title":"RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T08:53:29.468764Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.11151"},"observation_digest":"sha256:93fceba1dd77247e92330bc7542c4caac7707ac01270083c21e4f456faecfb47","observation_id":"6ff6e96e-8a17-48c8-9446-e719ce29eaaa","resolution":{"observed_at":"2026-05-21T08:54:05.817616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.16826","last_updated":"2026-05-16T06:05:27Z","snapshot_observed_at":"2026-08-01T18:34:23.456008Z","submitted_at":"2026-05-16T06:05:27Z","title":"Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T20:49:15.724896Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.16826"},"observation_digest":"sha256:f51922ebf62b8e31637ff39aab1bb5b0f10a97cfc28966388713182d57d5ac20","observation_id":"363088f6-84cb-4d4c-a516-d248c8a40dcf","resolution":{"observed_at":"2026-05-19T20:52:46.236699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.18320","last_updated":"2026-05-18T12:39:30Z","snapshot_observed_at":"2026-08-03T10:32:13.740060Z","submitted_at":"2026-05-18T12:39:30Z","title":"ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T12:07:21.037980Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.18320"},"observation_digest":"sha256:da124e8ec9837f51aaf22b82f391bd8c57a18a34f1b1fc81ada0f35362f97c1e","observation_id":"43d4de9f-b2d2-4358-b1d2-285c45147a1c","resolution":{"observed_at":"2026-05-20T12:08:15.443271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:57acbc37dd3abb67ceb9c46afb9030cf480fb02b9090956ea4be23ae86965448","observation_id":"91af34ea-1812-483d-9e44-00cd4875c82b","resolution":{"observed_at":"2026-05-22T07:51:16.575399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2606.21271","last_updated":"2026-06-19T09:47:38Z","snapshot_observed_at":"2026-07-06T23:56:17.293417Z","submitted_at":"2026-06-19T09:47:38Z","title":"Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T14:48:19.683101Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2606.21271"},"observation_digest":"sha256:5afbf850a8b23c2f2a5fdcdf332750e1fd396ece86d5f5186db6d738c0d74faa","observation_id":"1c1e04c5-22b8-4520-ac8b-0185d71fed66","resolution":{"observed_at":"2026-07-04T06:09:37.550272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2606.27475","last_updated":"2026-06-25T18:52:27Z","snapshot_observed_at":"2026-08-02T12:36:42.748876Z","submitted_at":"2026-06-25T18:52:27Z","title":"Support-Constrained RL Enables Real-World Policy Improvement without Real-World Experience","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T01:57:04.293058Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2606.27475"},"observation_digest":"sha256:54e6ea7a4c9e7b9139962bb00f544dfa734b8285508f2a99d62e646d04dd0a9f","observation_id":"96215305-918f-42b4-9869-48c085c7f94f","resolution":{"observed_at":"2026-07-01T18:25:58.742568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2606.27865","last_updated":"2026-06-26T09:06:04Z","snapshot_observed_at":"2026-08-01T15:37:44.932033Z","submitted_at":"2026-06-26T09:06:04Z","title":"From Bootstrapping to Sequence Modeling: A Unified Generative Framework for Personalized Landing-Page Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T02:56:52.303152Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2606.27865"},"observation_digest":"sha256:4a6e709e3c74c6375dc004e71250a1e79f6de344deaeab7e160df7bab12d5bea","observation_id":"d5013757-8dfe-4512-a595-49fb8945f0c8","resolution":{"observed_at":"2026-07-01T17:55:51.405173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2606.30627","last_updated":"2026-06-29T17:56:03Z","snapshot_observed_at":"2026-08-03T18:44:28.040312Z","submitted_at":"2026-06-29T17:56:03Z","title":"Pessimism's Paradox: Conservative Offline Training Amplifies Reward Hacking During Online Adaptation in Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T06:46:02.255137Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2606.30627"},"observation_digest":"sha256:53fe48c5bfb99a4765378b39c0ce539f4ee4a800641bcd8224a550ea4475ffab","observation_id":"fb1a7742-8efb-4993-a66b-a3fba610e1ad","resolution":{"observed_at":"2026-06-30T06:54:21.012695Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2607.02092","last_updated":"2026-07-03T08:21:35Z","snapshot_observed_at":"2026-07-30T21:34:57.906925Z","submitted_at":"2026-07-02T12:30:50Z","title":"Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-03T11:50:49.215046Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2607.02092"},"observation_digest":"sha256:ad4ef43d3adea18da021933f5a03b44812291ff53911ab09513f8e59e00254b6","observation_id":"09c7d9f4-c115-4b28-88b4-ff7706ff3381","resolution":{"observed_at":"2026-07-03T11:58:05.713079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-07-12T08:26:59.428524Z","title":"Conservative q- learning for offline reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02092","last_updated":"2026-07-03T08:21:35Z","snapshot_observed_at":"2026-07-30T21:34:57.906925Z","submitted_at":"2026-07-02T12:30:50Z","title":"Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T08:26:59.428524Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2607.02092"},"observation_digest":"sha256:7673fbedaf86883d7e6355ecb30a6473469b5f01f0e22860d95154e3456f4742","observation_id":"43654418-5787-417f-b0a6-d550dd7cc28f","resolution":{"observed_at":"2026-07-12T08:26:59.428524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-01T17:45:13.959321Z","title":"arXiv preprint arXiv:2006.04779 , year=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T05:48:59.999713Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:13.959321Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:58625aa30ffcab2e013d04613fa82619f90de517c510d4ca54e63502b96b0bec","observation_id":"b74f09b0-d2d0-424b-980b-f5c4a16560f2","resolution":{"observed_at":"2026-08-01T17:45:13.959321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-07-31T01:24:20.678068Z","title":"Conservative Q -learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.27422","last_updated":"2026-07-29T19:43:40Z","snapshot_observed_at":"2026-08-04T18:59:28.394917Z","submitted_at":"2026-07-29T19:43:40Z","title":"Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T01:24:20.678068Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2607.27422"},"observation_digest":"sha256:24a5e6811322f3fc3772e4c0443c56fc1adc8e5b949d21a2069b67fc8db858e1","observation_id":"ad055bab-729a-4f67-bdfa-70a49a77e3a4","resolution":{"observed_at":"2026-07-31T01:24:20.678068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-04T19:45:34.852244Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-05T10:24:36.436604Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:34.852244Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:8bff2390798b2a6b19ef0465012e2a2d39fbe70709247d6194eb83e724b2fbfb","observation_id":"536637ce-d99c-4c05-b02d-56f7c329c78d","resolution":{"observed_at":"2026-08-04T19:45:34.852244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2006.04779/citation-record","integrity":"/paper/2006.04779/integrity","json":"/paper/2006.04779/citation-record.json","paper":"/paper/2006.04779"},"outbound":[],"paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2006.04779."}