Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-10T20:24:21.925514Z
Paper Citation Record · LEDGER
As of 15 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 3 inbound Pith citation observations for arXiv:2501.08669.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-10T20:24:21.925514Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-05-21T07:36:12.214949Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-05-21T07:39:49.287335Z
30 of 30 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation c3db4edc-b61e-4c8b-9915-74da46ceeeb4 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Deep reinforcement learning: A brief survey
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3c0cede0-94ee-4e67-becc-ce289267b460 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Layer Normalization
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6a8d0cbc-09fc-45d8-888f-d0c2efaf225b · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Unresolved cited work
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 29eca1d7-2586-4177-bc6d-dd22f777b938 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Bellemare, and Aaron C
Reference 4
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation ea1a46c5-a1c6-4d04-9e03-c9fd7e22d65d · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning A minimalist approach to offline reinforcement learning
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 320356c6-f7c1-4e68-badb-d92546c35e17 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Addressing function approximation error in actor-critic methods
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a10d8e33-9020-47de-81cf-ec97322144f8 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3acdda27-5bfb-453a-afa9-fb692f600116 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Dropout Q-Functions for Doubly Efficient Reinforcement Learning
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d8061128-2d55-4be7-baa7-73bc36d15d5b · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Efficient deep reinforcement learning with imitative expert priors for autonomous driving
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c22e629f-3320-4d8d-8115-1cfc7b6fb075 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning When to Trust Your Model: Model-Based Policy Optimization
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3428810e-34ef-4644-ad1d-7fa9e714779c · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Offline Reinforcement Learning with Implicit Q-Learning
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0324d47b-fabe-4530-bdc1-82696d7cd8c3 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Conservative q-learning for offline reinforcement learning
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4ecbb4f3-a4df-4cd8-a0e0-1119031f40ff · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Maxmin Q-learning: Controlling the Estimation Bias of Q-learning
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 65ef302d-67b2-4e12-b143-c8d0610e64ac · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e7b0c99d-2172-42b1-aebf-3b01f4a6ac61 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Eliminating primacy bias in online reinforcement learning by self-distillation
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation b0f5eec1-118b-4cdc-bba5-e25d1014d894 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Think2drive: Efficient reinforcement learning by thinking with latent world model for autonomous driving (in carla-v2)
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation e19a1db9-05c1-446d-b902-e456e938e7cc · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Continuous control with deep reinforcement learning
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cfe48038-23de-4ac0-a0e1-f3f96a9eaba4 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Serl: A software suite for sample-efficient robotic reinforcement learning
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c9468d1a-be98-4105-b466-6e0450205a3d · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Off-policy rl algorithms can be sample-efficient for continuous control via sample multiple reuse
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation fc7ec346-6959-4c80-a796-65e34b7ff636 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning AWAC: Accelerating Online Reinforcement Learning with Offline Datasets
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ce269abf-50d2-4818-a532-fffc5ed804ab · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Deep Reinforcement Learning with Plasticity Injection
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 63ae0502-2021-43bc-a86b-bfe4d98a6dfd · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Learning Dexterous In-Hand Manipulation
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1a0ca1e9-1464-42a8-b285-15a4fe9e6d15 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Challenges of real-world reinforcement learning: definitions, benchmarks and analysis
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation ef842315-1f1c-4a73-b620-0a7762e5ae04 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Courville, Marc G
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 0293c6f9-6500-4874-8154-13f8c0c4e48b · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Dropout: A simple way to prevent neural networks from overfitting
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0b7e667a-549e-448c-b153-25a47edbcff9 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Reinforcement learning: An introduction
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation aef544f0-2ed0-49fc-a8fe-7713a79a1329 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ad1341c6-7447-4982-9e17-b146a4ffa28d · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning MuJoCo : A physics engine for model-based control
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 46df903e-e196-4ff4-ba8f-eb79d99e8e66 · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning Deep reinforcement learning with double q-learning
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 19d550be-29d4-4b40-bbf0-d3f2dd6e0bcb · outbound
SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning write newline
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d3226db3-8999-4e41-b2ed-557a553485b1 · inbound
Distributional Value Estimation Without Target Networks for Robust Quality-Diversity SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning
Reference 39
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation 7f147276-93d9-4b73-83bd-65f83a204543 · inbound
ARC-RL: A Reinforcement Learning Playground Inspired by ARC Raiders SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.
Observation f82172bd-0b00-4091-9b77-299ec47ae307 · inbound
ARC-RL: A Reinforcement Learning Playground Inspired by ARC Raiders SPEQ: Offline Stabilization Phases for Efficient Q-Learning in High Update-To-Data Ratio Reinforcement Learning
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.