{"as_of":"2026-08-15T09:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68a67efc55d2821766d3104af65b01f8f86a36a9785b9ada44b7ce679004c8f0","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:24:21.925514Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T07:36:12.214949Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T07:39:49.287335Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.08669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08669","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Carlo Romeo, Girolamo Macaluso, Alessandro Sestini, and Andrew D","venue":null,"work_id":"f487ae5b-0fd4-4877-8dd0-d48f6d174484","year":2025},"citing_paper":{"arxiv_id":"2604.20381","last_updated":"2026-04-22T09:31:45Z","snapshot_observed_at":"2026-08-12T15:15:48.202494Z","submitted_at":"2026-04-22T09:31:45Z","title":"Distributional Value Estimation Without Target Networks for Robust Quality-Diversity","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T00:11:04.222842Z"},"links":{"cited_paper":"/paper/2501.08669","citing_paper":"/paper/2604.20381"},"observation_digest":"sha256:554658fdbc2bf1a021319685378cd27b8d3622b0cca190f4524adaa23ada9dc4","observation_id":"d3226db3-8999-4e41-b2ed-557a553485b1","resolution":{"observed_at":"2026-05-10T00:14:46.890229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.08669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08669","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Carlo Romeo, Girolamo Macaluso, Alessandro Sestini, and Andrew D","venue":null,"work_id":"f487ae5b-0fd4-4877-8dd0-d48f6d174484","year":2025},"citing_paper":{"arxiv_id":"2605.19503","last_updated":"2026-05-20T07:37:16Z","snapshot_observed_at":"2026-08-13T20:07:36.919741Z","submitted_at":"2026-05-19T07:54:40Z","title":"ARC-RL: A Reinforcement Learning Playground Inspired by ARC Raiders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T05:28:50.354662Z"},"links":{"cited_paper":"/paper/2501.08669","citing_paper":"/paper/2605.19503"},"observation_digest":"sha256:0c58d6177f02827847f4684a0e69ac5fea7de3243169e9f6af750cf04a9eb730","observation_id":"7f147276-93d9-4b73-83bd-65f83a204543","resolution":{"observed_at":"2026-05-20T05:33:04.201008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.08669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.08669","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Carlo Romeo, Girolamo Macaluso, Alessandro Sestini, and Andrew D","venue":null,"work_id":"f487ae5b-0fd4-4877-8dd0-d48f6d174484","year":2025},"citing_paper":{"arxiv_id":"2605.19503","last_updated":"2026-05-20T07:37:16Z","snapshot_observed_at":"2026-08-13T20:07:36.919741Z","submitted_at":"2026-05-19T07:54:40Z","title":"ARC-RL: A Reinforcement Learning Playground Inspired by ARC Raiders","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T07:36:12.214949Z"},"links":{"cited_paper":"/paper/2501.08669","citing_paper":"/paper/2605.19503"},"observation_digest":"sha256:284a043def1708c74ec7378d0abf2cd4c785858a3d3edddbadd042345c45b22e","observation_id":"f82172bd-0b00-4091-9b77-299ec47ae307","resolution":{"observed_at":"2026-05-21T07:39:49.289899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.08669/citation-record","integrity":"/paper/2501.08669/integrity","json":"/paper/2501.08669/citation-record.json","paper":"/paper/2501.08669"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.804878Z","title":"Deep reinforcement learning: A brief survey","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.804878Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:44650ba00c464786228c7b8396d05d075129912135e9e52e95d094a363f295e2","observation_id":"c3db4edc-b61e-4c8b-9915-74da46ceeeb4","resolution":{"observed_at":"2026-08-10T20:24:21.804878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-10T20:24:21.809683Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.809683Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:115babe6e7c67d88a44fabc92359eb3d0c93689432c4ef50c1e2f192c4f78fa3","observation_id":"3c0cede0-94ee-4e67-becc-ce289267b460","resolution":{"observed_at":"2026-08-10T20:24:21.809683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:22.407672Z","title":null,"venue":null,"work_id":"1231a4b8-f8aa-469c-8a12-78ebaefd5981","year":2021},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.813914Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:b801377df02789c606f875e1690edfed422b6f6a500c43559f37cc66c3788b7f","observation_id":"6a8d0cbc-09fc-45d8-888f-d0c2efaf225b","resolution":{"observed_at":"2026-08-10T20:24:22.412106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:22.394869Z","title":"Bellemare, and Aaron C","venue":null,"work_id":"d87d6756-7088-43d0-8d4a-a60527f2fb42","year":2023},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.819761Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:262c0a692f50cf3d1c4be2d0d6f828d947087b3c61439fc3f1ea833aa5ecb73c","observation_id":"29eca1d7-2586-4177-bc6d-dd22f777b938","resolution":{"observed_at":"2026-08-10T20:24:22.399073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.823840Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.823840Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:aadbeee57e27fc4f525807093b847311ade9d9f6dc18ed242277d5e30c3f7a6d","observation_id":"ea1a46c5-a1c6-4d04-9e03-c9fd7e22d65d","resolution":{"observed_at":"2026-08-10T20:24:21.823840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.828054Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.828054Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:92185b5ac17d0e99bdc253636da37c74912b90647352af9e9b5ca95820eb3c93","observation_id":"320356c6-f7c1-4e68-badb-d92546c35e17","resolution":{"observed_at":"2026-08-10T20:24:21.828054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-10T20:24:21.832429Z","title":"Abbeel, and Sergey Levine","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.832429Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:efa4b0d64a0644302fce0ef46468566aeacb1b809c90e01b26b729fbe5704341","observation_id":"a10d8e33-9020-47de-81cf-ec97322144f8","resolution":{"observed_at":"2026-08-10T20:24:21.832429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02034","last_updated":"2022-03-16T13:38:46Z","snapshot_observed_at":"2026-08-13T17:59:15.927549Z","submitted_at":"2021-10-05T13:28:11Z","title":"Dropout Q-Functions for Doubly Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02034","snapshot_observed_at":"2026-08-10T20:24:21.837385Z","title":"Dropout q-functions for doubly efficient reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.837385Z"},"links":{"cited_paper":"/paper/2110.02034","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:75153aab94c4a097eb8e468448314318a7e98aa6c7a04767a10778c23d642f32","observation_id":"3acdda27-5bfb-453a-afa9-fb692f600116","resolution":{"observed_at":"2026-08-10T20:24:21.837385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.841673Z","title":"Efficient deep reinforcement learning with imitative expert priors for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.841673Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:fe24b02150865f4413ca5e1c2c1ad88f1451a73f877550d474ac61a77784615a","observation_id":"d8061128-2d55-4be7-baa7-73bc36d15d5b","resolution":{"observed_at":"2026-08-10T20:24:21.841673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08253","last_updated":"2021-11-29T00:49:49Z","snapshot_observed_at":"2026-08-14T16:13:11.186612Z","submitted_at":"2019-06-19T17:54:53Z","title":"When to Trust Your Model: Model-Based Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08253","snapshot_observed_at":"2026-08-10T20:24:21.845378Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.845378Z"},"links":{"cited_paper":"/paper/1906.08253","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:ae6f4156715ca064adc4270f251140217d628972e5e2849c17cb4cede4b9d9dc","observation_id":"c22e629f-3320-4d8d-8115-1cfc7b6fb075","resolution":{"observed_at":"2026-08-10T20:24:21.845378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-10T20:24:21.849813Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.849813Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:def196202fe936c4ff3713489cd33563c11e0e644d7c6794761294b1dc278841","observation_id":"3428810e-34ef-4644-ad1d-7fa9e714779c","resolution":{"observed_at":"2026-08-10T20:24:21.849813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.853964Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.853964Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:f12f0a6f8f443d59338b80efedc70eaf1325adf1645d4d9054436e37247fd814","observation_id":"0324d47b-fabe-4530-bdc1-82696d7cd8c3","resolution":{"observed_at":"2026-08-10T20:24:21.853964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06487","last_updated":"2021-08-07T18:51:37Z","snapshot_observed_at":"2026-08-08T20:16:19.069312Z","submitted_at":"2020-02-16T02:02:23Z","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06487","snapshot_observed_at":"2026-08-10T20:24:21.857688Z","title":"Maxmin q-learning: Controlling the estimation bias of q-learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.857688Z"},"links":{"cited_paper":"/paper/2002.06487","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:47b373f9646291d985ba04df96bd0c6b46c91f3d7e93b9a388065e07b15a51a5","observation_id":"4ecbb4f3-a4df-4cd8-a0e0-1119031f40ff","resolution":{"observed_at":"2026-08-10T20:24:21.857688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-10T20:24:21.862302Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.862302Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:0f1372038a1475598b8ea2e95436a6156f997862b6969b862c794595c3142388","observation_id":"65ef302d-67b2-4e12-b143-c8d0610e64ac","resolution":{"observed_at":"2026-08-10T20:24:21.862302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:22.358243Z","title":"Eliminating primacy bias in online reinforcement learning by self-distillation","venue":null,"work_id":"993e0199-1e62-4695-ab51-ba69a5ccb368","year":2024},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.866405Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:101a4602c06d47e6b62db48a58b9200af9fd3cdea214a4657364d9d5a0528ceb","observation_id":"e7b0c99d-2172-42b1-aebf-3b01f4a6ac61","resolution":{"observed_at":"2026-08-10T20:24:22.362644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:22.345597Z","title":"Think2drive: Efficient reinforcement learning by thinking with latent world model for autonomous driving (in carla-v2)","venue":null,"work_id":"fa4f9457-a525-4e15-bc08-554fc4776970","year":2024},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.870390Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:a7dda3fcb1554556df3e2de00adb569b05c7be887bcec6f51e21c3f5150e5150","observation_id":"b0f5eec1-118b-4cdc-bba5-e25d1014d894","resolution":{"observed_at":"2026-08-10T20:24:22.349887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-10T20:24:21.874294Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.874294Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:50fb974abac23632d59f616ecc48babb195b6fbbcc8c4c2b6cb1355c370856de","observation_id":"e19a1db9-05c1-446d-b902-e456e938e7cc","resolution":{"observed_at":"2026-08-10T20:24:21.874294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.878269Z","title":"Serl: A software suite for sample-efficient robotic reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.878269Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:5ce7f740c01a02da12394b6273b33b9b11aa24a0fedf8365ebddd03b34d7dee8","observation_id":"cfe48038-23de-4ac0-a0e1-f3f96a9eaba4","resolution":{"observed_at":"2026-08-10T20:24:21.878269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:22.332302Z","title":"Off-policy rl algorithms can be sample-efficient for continuous control via sample multiple reuse","venue":null,"work_id":"45e1f7ce-fa0b-4e59-9dfe-09b00fc2a41a","year":2023},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.882350Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:8f17fd92deb581eba3f2a1a86a51af51f3c0c9f54d37659a8353f1f15cb6faef","observation_id":"c9468d1a-be98-4105-b466-6e0450205a3d","resolution":{"observed_at":"2026-08-10T20:24:22.336723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-10T20:24:21.886841Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.886841Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:07a0a394a28e0c309e7bbbaa84443e16c0883d4c61d7355863c3f21da1a9ee02","observation_id":"fc7ec346-6959-4c80-a796-65e34b7ff636","resolution":{"observed_at":"2026-08-10T20:24:21.886841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15555","last_updated":"2023-10-03T21:51:58Z","snapshot_observed_at":"2026-08-13T11:34:02.609235Z","submitted_at":"2023-05-24T20:41:35Z","title":"Deep Reinforcement Learning with Plasticity Injection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15555","snapshot_observed_at":"2026-08-10T20:24:21.890658Z","title":"Deep reinforcement learning with plasticity injection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.890658Z"},"links":{"cited_paper":"/paper/2305.15555","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:6fb917e44df2b674c81afe4af9a94cc3b8707f87b58078cec7cf6624dd9603fa","observation_id":"ce269abf-50d2-4818-a532-fffc5ed804ab","resolution":{"observed_at":"2026-08-10T20:24:21.890658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00177","last_updated":"2019-01-18T23:26:53Z","snapshot_observed_at":"2026-08-15T09:50:05.472037Z","submitted_at":"2018-08-01T06:02:36Z","title":"Learning Dexterous In-Hand Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.00177","snapshot_observed_at":"2026-08-10T20:24:21.894926Z","title":"Pachocki, Jakub Pachocki, Arthur Petron, Matthias Plappert, Glenn Powell, Alex Ray, Jonas Schneider, Szymon Sidor, Josh Tobin, Peter Welinder, Lilian Weng, and Wojciech Zaremba","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.894926Z"},"links":{"cited_paper":"/paper/1808.00177","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:3c5c5cf873cf9c90744686ebd81f53e817e6719af96ca563fb445f6c56ecbfb8","observation_id":"63ae0502-2021-43bc-a86b-bfe4d98a6dfd","resolution":{"observed_at":"2026-08-10T20:24:21.894926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:22.320290Z","title":"Challenges of real-world reinforcement learning: definitions, benchmarks and analysis","venue":null,"work_id":"67286666-edca-4b45-9af9-7ac46899ca1c","year":2021},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.899014Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:f30b8e0447b1e9ac7defffa7312a8ae0511f2ddc57dd0728c3f1a8a5e5ac265f","observation_id":"1a0ca1e9-1464-42a8-b285-15a4fe9e6d15","resolution":{"observed_at":"2026-08-10T20:24:22.324748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:22.308220Z","title":"Courville, Marc G","venue":null,"work_id":"ad673a12-9722-405e-b31b-4699e72f231c","year":2023},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.902874Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:44af83870a1c7d3f3809da5956995c95c0be6d2938f12b8fb62c452091cfce64","observation_id":"ef842315-1f1c-4a73-b620-0a7762e5ae04","resolution":{"observed_at":"2026-08-10T20:24:22.312429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.906957Z","title":"Dropout: A simple way to prevent neural networks from overfitting","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.906957Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:82acee3b665643eb63830583453644960fa009b6964a482c80313855194e126d","observation_id":"0293c6f9-6500-4874-8154-13f8c0c4e48b","resolution":{"observed_at":"2026-08-10T20:24:21.906957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.910655Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.910655Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:6bb385e59a00e16f563843e4081691f302cd17a28eea5dba70b2d21e34aab67b","observation_id":"0b7e667a-549e-448c-b153-25a47edbcff9","resolution":{"observed_at":"2026-08-10T20:24:21.910655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03539","last_updated":"2024-09-16T15:41:05Z","snapshot_observed_at":"2026-08-15T07:56:22.169349Z","submitted_at":"2024-08-07T04:35:38Z","title":"Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03539","snapshot_observed_at":"2026-08-10T20:24:21.914535Z","title":"Deep reinforcement learning for robotics: A survey of real-world successes, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.914535Z"},"links":{"cited_paper":"/paper/2408.03539","citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:2fd4c20b276b98c8d2889dd5a8773faab510b96d99f6f91ce448717a5c1053d7","observation_id":"aef544f0-2ed0-49fc-a8fe-7713a79a1329","resolution":{"observed_at":"2026-08-10T20:24:21.914535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:22.277416Z","title":"MuJoCo : A physics engine for model-based control","venue":null,"work_id":"73413965-3790-4658-a32d-b3c5f9f85700","year":2012},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.918454Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:f288857777aef092b87b09a048ec84b9f84a60698f1e836cdd06340dfc65cfad","observation_id":"ad1341c6-7447-4982-9e17-b146a4ffa28d","resolution":{"observed_at":"2026-08-10T20:24:22.283628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.922068Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.922068Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:2310bfab5e9d02beba73eb0202ea2a785906cb0e5c80f7b3096a274f021c51ee","observation_id":"46df903e-e196-4ff4-ba8f-eb79d99e8e66","resolution":{"observed_at":"2026-08-10T20:24:21.922068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:24:21.925514Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:24:21.925514Z"},"links":{"citing_paper":"/paper/2501.08669"},"observation_digest":"sha256:09b289d26584214c6b4d82f88e25f4be1e676e96ec71db94962c574a9ed8c71c","observation_id":"19d550be-29d4-4b40-bbf0-d3f2dd6e0bcb","resolution":{"observed_at":"2026-08-10T20:24:21.925514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.08669","last_updated":"2025-03-18T12:54:07Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T07:56:13.500585Z","submitted_at":"2025-01-15T09:04:19Z","title":"SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 3 inbound Pith citation observations for arXiv:2501.08669."}