Pith. sign in

Paper Citation Record · LEDGER

D4RL: Datasets for Deep Data-Driven Reinforcement Learning

As of 5 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 100 inbound Pith citation observations for arXiv:2004.07219.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2004.07219 v4

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-12T23:19:17.322890Z

measured 124 of 124 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 100 of 130 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T15:52:46.789736Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

24 of 24 outbound references displayed

  • verified exact13
  • verified fuzzy5
  • unresolved0
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch5

External citation measurements

332
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation a3c1607c-ae24-4103-a6d5-ac4d1bf911e0 · outbound

This paper cites On the Theory of Policy Gradient Methods: Optimality, Approximation, and Distribution Shift.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning On the Theory of Policy Gradient Methods: Optimality, Approximation, and Distribution Shift

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.350031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:497aadfce4732393259e557a8dd17919bacc02606737c980b70154400240d01c

Observation 4ddb077d-4ab4-4e16-8f28-80bfed67cb41 · outbound

This paper cites Scaling data-driven robotics with reward sketching and batch reinforcement learning.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Scaling data-driven robotics with reward sketching and batch reinforcement learning

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.358030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:a6c5c8f3a120e66b4e5d2247d0e220eb29babe78c93c5dfa7022fa162824a8b4

Observation e9534e1a-3b3b-4f71-b5cc-fe50080a65fb · outbound

This paper cites End- to-end driving via conditional imitation learning.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning End- to-end driving via conditional imitation learning

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-12T23:19:17.454535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:c54f695c3f34599168ef0232b6747b58a26f1358a2b8c4d454804b359622a4d4

Observation 27625d21-bc61-4912-97bf-001f9bab866e · outbound

This paper cites Challenges of Real-World Reinforcement Learning.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Challenges of Real-World Reinforcement Learning

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.399937Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:78f30a05a57b246ac500d7fd7c1beab485cfa737acb38462442bfef24590de61

Observation bfc646a4-47b4-4068-84fa-e9b213030d6c · outbound

This paper cites An empirical investigation of the challenges of real-world reinforcement learning.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning An empirical investigation of the challenges of real-world reinforcement learning

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.403954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:99442e504c617f33ca2349ada9f145b43996b4a1e5fa826baae6b96152b93342

Observation 22f1d582-6358-4ddc-9f69-86b106be883b · outbound

This paper cites Off-Policy Deep Reinforcement Learning without Exploration.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Off-Policy Deep Reinforcement Learning without Exploration

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.409114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:563ed7c23c8e8adc082e424f0ca4cd6bf6f90261f7b6cc74abe7e8ed0d85e116

Observation f4bc3789-f7d7-4bf4-91aa-81d2fe885d58 · outbound

This paper cites Deep reinforcement learning for robotic manipulation with asynchronous off-policy updates.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Deep reinforcement learning for robotic manipulation with asynchronous off-policy updates

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-12T23:19:17.471486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:025c0a6f9bd185ed27179f8866ef8e9f46dd77f5120487b28283f5d49f3a0f99

Observation b0592225-ea90-47e1-bf98-8704da4577f9 · outbound

This paper cites Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.414978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:81027b5a9df6b3e4eb8c9267216a9152445c9568896877a17330713bd4dfbb18

Observation 5c4e3e26-8a0c-4db9-a6d1-16be3f6ac593 · outbound

This paper cites Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:48:10.852058Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:b8a54a48b3056bb07498ce0769d70312e35ac8ba2992d02025959f1e23c147ea

Observation 68df719a-6080-45f7-8205-a8f327926b17 · outbound

This paper cites A Real-Time Model-Based Reinforcement Learning Architecture for Robot Control.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning A Real-Time Model-Based Reinforcement Learning Architecture for Robot Control

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-07-04T19:25:11.510470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:43c50f745869df36f906526a294ba35ec3527773f0ff2fece96b204ebbeb13d1

Observation c6677e0b-b8ef-479f-83b7-a04ff281d78c · outbound

This paper cites RecSim: A Configurable Simulation Platform for Recommender Systems.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning RecSim: A Configurable Simulation Platform for Recommender Systems

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.432972Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:bfac2047ea47a55f6b50df495ef0ed4f14f114b02828234b9fcc6191877c5b0f

Observation 8850fa17-b592-49b3-914c-3ca670d20d07 · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.438895Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:7ddc298977a270ce1e38ce3b126e8c61760c1ffab153456e036c774905ffeda0

Observation ce0e9a44-c3ff-492d-8b41-c1a1bd497106 · outbound

This paper cites Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction

Reference 14

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.444141Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:2e73d7ee6b6998298a8105f080e4167c4281822c2bb557fb8977b72b76ef3992

Observation b1bc3922-d0e6-40bc-89f5-08672e92a0da · outbound

This paper cites Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-05-12T23:19:17.449574Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:f16d028596cab1514bea68c730a239ee3f5f9534009e52ded4b5d3dfaf6317f4

Observation dcb8eeaf-0b4c-4764-8eac-50538e18f1bf · outbound

This paper cites AlgaeDICE: Policy Gradient from Arbitrary Experience.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning AlgaeDICE: Policy Gradient from Arbitrary Experience

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.364644Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:8261c0b48a552256a47ffa1dd0005aef0c5879d40ad63ec8f4c2134cbaf5f4ff

Observation 60ec4de0-a61c-4ee8-a7dc-fdc81d508179 · outbound

This paper cites AWAC: Accelerating Online Reinforcement Learning with Offline Datasets.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning AWAC: Accelerating Online Reinforcement Learning with Offline Datasets

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-13T03:41:13.013491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:a3a11caaf21174e824637e8fadd52e3f4e8c81927eb6b6981dab162738cdeaa1

Observation 9ca6c1c0-191a-407d-9f18-79a353236244 · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-05-12T23:19:17.378013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:bc53e78766233db90600c27205e261d0ef7d22bdf249afb198b7e976c1980c8d

Observation fb030031-43ef-4ba9-9115-f9d6f05640f3 · outbound

This paper cites Deep Imitative Models for Flexible Inference, Planning, and Control.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Deep Imitative Models for Flexible Inference, Planning, and Control

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.383831Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:cd7b6feb464641fc4ff594e14372f4a034e0cdc42d8b1630c44ba7b91b393666

Observation 5fc180cd-e726-4dbd-8194-476c6204ed10 · outbound

This paper cites Mujoco: A physics engine for model-based control.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Mujoco: A physics engine for model-based control

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-12T23:19:17.466685Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:54754775dc009198781f058fd9e4e9f1ef02884e80980dd0e5115a80ef044e91

Observation 50a3e41c-c4df-4057-923a-f163b7cf1b81 · outbound

This paper cites Flow: A Modular Learning Framework for Mixed Autonomy Traffic.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Flow: A Modular Learning Framework for Mixed Autonomy Traffic

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-06-04T20:12:14.318237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:3d9ce7c0b39b305b906832ca40287f1d5c03cad9c03374fe0ef5de876b906de7

Observation f23487c3-36f7-43bf-8abd-e58104d9bd1f · outbound

This paper cites Behavior Regularized Offline Reinforcement Learning.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Behavior Regularized Offline Reinforcement Learning

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-13T15:19:21.456208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:1ed8905413d263018b03e5f758e64d69e2615d18ace87097e8195bf2377998ad

Observation a382beaf-5594-4e50-b63d-4ec349c568b9 · outbound

This paper cites carla-town.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning carla-town

Reference 23

Resolution
malformed identifier
raw_fallback, observed 2026-05-12T23:19:17.462257Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:7350e39e851095890e16e853a0dcc9992c2368c54d2cabcfb637cc70b5c51e2c

Observation 9d668e8c-4184-4d06-ab12-a8f095779585 · outbound

This paper cites (2017) Random, Controller Franka Kitchen Gupta et al.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning (2017) Random, Controller Franka Kitchen Gupta et al

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-12T23:19:17.476151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:d913fff0dbd2062b8f8620856682be4ddb5409a0d2c93927ed6ae38b436a633a

Observation 4fa517c2-2747-4d59-997a-b9a64c062f02 · outbound

This paper cites Training.

D4RL: Datasets for Deep Data-Driven Reinforcement Learning Training

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-12T23:19:17.458461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T23:19:17.322890Z digest=sha256:b034613e6f4b228efa5e5bd9331324620781410191b1bd5922dc6a13444c7b57

Pith citing papers

Observation b03cbe9c-e8f5-4b3c-af90-3dc6ed420c31 · inbound

Decision Transformer: Reinforcement Learning via Sequence Modeling cites this paper.

Decision Transformer: Reinforcement Learning via Sequence Modeling D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:11:11.350481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-18T15:11:11.056013Z digest=sha256:cd57baebe7a1dbb399ea3cf5bef9dcece8830e02555718fd209de103dba73a3a

Observation 96a97e61-ac58-4ab4-83c0-86c1fe1e232e · inbound

What Matters in Learning from Offline Human Demonstrations for Robot Manipulation cites this paper.

What Matters in Learning from Offline Human Demonstrations for Robot Manipulation D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-05-13T08:51:55.889484Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-13T08:51:55.826747Z digest=sha256:4b0611ac8b1b607488fb48c054f1a4a29a5aceac92314eca8ab993c057ddd61f

Observation f0990480-5133-486b-98f6-55088ccd70d6 · inbound

Offline Reinforcement Learning with Implicit Q-Learning cites this paper.

Offline Reinforcement Learning with Implicit Q-Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T08:47:05.621624Z digest=sha256:f97817a8b40e71b434c72ccd054dde3eff2aa156b96b047b9ece1274c51e7eff

Observation eb7e1477-4135-4d10-aa68-f0701e0b9b29 · inbound

A Generalist Agent cites this paper.

A Generalist Agent D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-05-13T06:24:50.003323Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-13T06:24:49.833638Z digest=sha256:d99f26d4b32427b624302989cfef06a29221c08762282c6396e76db03b596142

Observation 056b3df7-809a-4f66-9d87-30044f2e8677 · inbound

Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning cites this paper.

Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-05-15T07:55:15.719096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-15T07:55:15.678348Z digest=sha256:d91665e83443bbd0a7a5747d0774e94fca9e14ac53248bbb23b167cda868712a

Observation 2e383054-929e-49e3-aa6c-3220cb086042 · inbound

IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies cites this paper.

IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-13T13:48:36.463593Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-13T13:48:36.369334Z digest=sha256:8b6c5fb7154b2b6bf5c432c40bc022c5bbc30a7208b7285476d31905b62f1aa3

Observation 8121b253-57dc-4d88-9350-1a3797ac843d · inbound

Reinforced Self-Training (ReST) for Language Modeling cites this paper.

Reinforced Self-Training (ReST) for Language Modeling D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 8

Resolution
metadata mismatch
local_arxiv, observed 2026-05-13T07:59:55.994990Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-13T07:59:55.849296Z digest=sha256:6af01b391e627adb2d8d6c414592598c93bbdcd625958e1309b79e297df82242

Observation 6007e803-a731-4848-9346-735f01200ceb · inbound

Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution cites this paper.

Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 115

Resolution
metadata mismatch
local_arxiv, observed 2026-05-16T08:12:31.498323Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-16T08:12:30.984870Z digest=sha256:a4148b651db539881c058d340e09cfcef115e7ce528dac8cc7bebef9b179ff2e

Observation b443c3ce-7dc3-4900-abf3-2cee4db9d8d8 · inbound

CROP: Conservative Reward for Model-based Offline Policy Optimization cites this paper.

CROP: Conservative Reward for Model-based Offline Policy Optimization D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-24T06:39:01.273066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-24T06:37:57.104233Z digest=sha256:e56458f7f217f8223c376f46116b19ab751cd139dc3b93b958145565e37cbb67

Observation 5a6f5bcd-6534-4829-b82c-b488f681c20d · inbound

Diffusion Policy Policy Optimization cites this paper.

Diffusion Policy Policy Optimization D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-05-16T08:48:14.822907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-16T08:48:14.776754Z digest=sha256:d21830007f7f3aa78a94c50b2e1625a4533312b36e6e94f0adeb31e36c8c846d

Observation 87d777e8-925b-4e41-a35a-3eb5d2dc0e9e · inbound

DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning cites this paper.

DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-05-17T16:06:09.706298Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-17T16:06:09.448517Z digest=sha256:8c77de6389d6b183bcd1d7480a50045da2ccb8d59678fe89b6613218d827a0a4

Observation 768d8265-374c-461e-99ae-d608acbccdaa · inbound

SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks cites this paper.

SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-05-25T08:35:32.373740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-25T08:33:45.689151Z digest=sha256:feff10863532183a8775ecf342ff349b94285e3f548cbf770f1d88e2fc41c76a

Observation 0b98c64b-e5f3-40c2-a30c-c8984397de76 · inbound

Self-Improving Skill Learning for Robust Skill-based Meta-Reinforcement Learning cites this paper.

Self-Improving Skill Learning for Robust Skill-based Meta-Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-05-23T03:25:20.960243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-23T03:22:25.891899Z digest=sha256:24de12485d6c75628bc95b8176fe52a7442d86407c40bf0185d1cc91980ec063

Observation f2cadc78-32f1-4156-8ad2-cbb1b08b6c3e · inbound

VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning cites this paper.

VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-05-22T19:35:03.974184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-22T19:34:33.263674Z digest=sha256:01c99b5cebbb9543b0abcb622c4b00fa3a99b8e475e3d2a4c8756204827d14ed

Observation 082498cf-373b-4224-8c6f-e362e0bc2cbc · inbound

Using Ensemble Diffusion to Estimate Uncertainty for End-to-End Autonomous Driving cites this paper.

Using Ensemble Diffusion to Estimate Uncertainty for End-to-End Autonomous Driving D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-05-25T08:20:32.161757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-25T08:18:07.233257Z digest=sha256:72350be3de2c9a492221036b5a4fee965909db3e46bebfd8f9711d60590aded0

Observation 08e7d6ac-5f1e-46a2-a11f-46da1e673db4 · inbound

BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning cites this paper.

BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-19T10:52:15.282652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T10:48:28.980868Z digest=sha256:4c1dd4f49b8de16d14de7780fc6c2242cf52ba509d291d83a5085b08d1c38dd1

Observation 5aad7009-083e-488c-9af3-ed08460e21cd · inbound

Reinforcement Learning with Action Chunking cites this paper.

Reinforcement Learning with Action Chunking D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-05-19T05:22:06.438696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T05:18:20.960945Z digest=sha256:2b231434095346cb31ec3b9ce2c98a6f944f021beea89ef81bed7f07b868b522

Observation def2e6e4-6bb0-4153-ab55-74b75950ddb4 · inbound

EXPO: Stable Reinforcement Learning with Expressive Policies cites this paper.

EXPO: Stable Reinforcement Learning with Expressive Policies D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 8

Resolution
metadata mismatch
local_arxiv, observed 2026-05-19T05:12:05.233681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T05:09:02.111308Z digest=sha256:d37d54d9dd51f17ffc045caed05c51fa757d5bc993c2cef46653ddcc932d5cad

Observation a95ed71a-ccb4-4cca-8a15-e917a0b43254 · inbound

Re:Frame -- Retrieving Experience From Associative Memory cites this paper.

Re:Frame -- Retrieving Experience From Associative Memory D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T15:52:46.789736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:52:46.789736Z digest=sha256:2b506ca2d5e9fd2ff92c2ffd688fc1c02e85307eae3c72f91ba7da2e2ec246c8

Observation 4d68f3ad-e4fc-40e6-be86-ce3a31ed6f15 · inbound

LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning cites this paper.

LLM-Driven Policy Diffusion: Enhancing Generalization in Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-05T13:46:02.304215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:46:02.304215Z digest=sha256:d1f2cd4ee6be8d0131269a1f53d4606b033471b271f7f4dde303b6c78aeb15e4

Observation 8b32a97b-13a5-429d-8f21-7299b022d80f · inbound

Generative Auto-Bidding in Large-Scale Competitive Auctions via Diffusion Completer-Aligner cites this paper.

Generative Auto-Bidding in Large-Scale Competitive Auctions via Diffusion Completer-Aligner D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-05T11:03:47.045375Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T11:03:47.045375Z digest=sha256:7f21e56f3e711028cec9171dff7a1f882559bf0cae02b5786f16ca57c9f2e736

Observation 105b4d2d-95fe-4035-8093-997cfb7f6976 · inbound

RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction cites this paper.

RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T21:32:56.756509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T21:32:56.756509Z digest=sha256:766d416626de4b860abaa65fc489bb8fe6e7a1577b11106980151bf0ee41c3af

Observation fbd857a9-8bbf-4418-9d10-9f27dceac450 · inbound

Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning cites this paper.

Wavelet Fourier Diffuser: Frequency-Aware Diffusion Model for Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T10:30:59.176386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T10:30:59.176386Z digest=sha256:e06a09fe10521fe94d40307e062eeb9137014ab6ef941860e8f6de0fe1619101

Observation 31d12c3c-6aa9-4e46-b2e8-bcc925e672c5 · inbound

Geometric Analysis of Neural Regression Collapse via Intrinsic Dimension cites this paper.

Geometric Analysis of Neural Regression Collapse via Intrinsic Dimension D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-18T10:22:33.167687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-18T10:22:28.096542Z digest=sha256:84f6ecf6faf008ce1f9e360427b296814e632a3450b4e9951ac4e762654f2083

Observation 5456f005-3387-4bba-9222-69cef5bd08d8 · inbound

The Three Regimes of Offline-to-Online Reinforcement Learning cites this paper.

The Three Regimes of Offline-to-Online Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T13:00:06.749438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T13:00:06.749438Z digest=sha256:9a03c276ceb8e901b2a440d6fd78264f73b3f44f60e757e8c51a661aff7efd9c

Observation 6ff1f605-4b91-41a4-928e-48d7f8e0ade7 · inbound

Distributional Inverse Reinforcement Learning cites this paper.

Distributional Inverse Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T12:42:57.503906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T12:42:57.503906Z digest=sha256:2f3c6d3626a4c05144af1a824d8c61a8371a289cb3aa686b983ad760f7876be1

Observation b3b4b8d2-937b-461b-9751-b200c71aea67 · inbound

Value Flows cites this paper.

Value Flows D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T11:01:29.019869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:01:29.019869Z digest=sha256:3d2e48b32f7cd557549a90b9e91fd7bfc758e0c1d8688b9c8c1237336819f54e

Observation 88ac4429-a9b8-48c8-b863-761caf8642c7 · inbound

When a Robot is More Capable than a Human: Learning from Constrained Demonstrators cites this paper.

When a Robot is More Capable than a Human: Learning from Constrained Demonstrators D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-05-18T08:36:07.502681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-18T08:32:31.324408Z digest=sha256:c8e105210879d966ef83c0d139ef667807721de75b803c2cf4eea3460cce9ee0

Observation 8b9c1b37-a5b4-4536-ad75-32bf82f10675 · inbound

From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning cites this paper.

From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-18T00:40:34.089204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-18T00:36:32.681470Z digest=sha256:2e269884f6227f3e6080aa5739a94b1a38bbbaf2d1ba11f2d8136a5bc5f8ce56

Observation 5187225d-4763-413e-8056-f61c646e943b · inbound

From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning cites this paper.

From Static Constraints to Dynamic Adaptation: Sample-Level Constraint Relaxation for Offline-to-Online Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-21T19:04:19.080330Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T19:02:38.240098Z digest=sha256:5bb383286ec464e3143e1f97626762a532d575c07ef0ddcbe5ebd67d21a89764

Observation 35d8367b-ce4e-4e4a-b7b2-c7bb1c9c8b11 · inbound

HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization cites this paper.

HardFlow: Hard-Constrained Sampling for Flow-Matching Models via Trajectory Optimization D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 55

Resolution
verified exact
local_arxiv, observed 2026-05-17T23:40:31.687030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-17T23:35:58.055724Z digest=sha256:a3207c4687e14b6b708711936652b2dec53390b158132cc210e3986c7361c70c

Observation 4de086e7-0914-4087-887c-b83b1a45af85 · inbound

Enhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware Minimization cites this paper.

Enhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware Minimization D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-17T22:40:23.549987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-17T22:38:44.634676Z digest=sha256:61a9abe336f9be71502bf280bbe11767c25675d517f9034845c48dd5b41b2aee

Observation d823fb07-b89e-4f25-a906-c48b7bf19298 · inbound

Training Diffusion Policies via Prior-Mapping Co-Evolution cites this paper.

Training Diffusion Policies via Prior-Mapping Co-Evolution D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-03T19:03:02.677475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T19:03:02.677475Z digest=sha256:194f0210124c024ff7388d50a2a51b7367ec9e75a6d26ea11a900a46983e1261

Observation afc9e374-ce41-4c19-8a29-4bd2ca6cb10a · inbound

What Drives Success in Physical Planning with Joint-Embedding Predictive World Models? cites this paper.

What Drives Success in Physical Planning with Joint-Embedding Predictive World Models? D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-21T15:34:15.055466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-21T15:33:24.616338Z digest=sha256:fecb9b9127a7578c6a62caa7a694de4dbdf2541be530f3b4f5e1f27981988545

Observation 0097d759-404e-46a8-8509-b5575182b672 · inbound

Agile Reinforcement Learning through Separable Neural Architecture and Applications cites this paper.

Agile Reinforcement Learning through Separable Neural Architecture and Applications D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-03T06:13:00.031328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T06:13:00.031328Z digest=sha256:08842c25a867393e00183447c6bbc6116cbcaa289b47232eb6da0e4efca6119d

Observation 6bdbc15a-247f-426f-9354-62caed138ed6 · inbound

Optimization and Generation in Aerodynamics Inverse Design cites this paper.

Optimization and Generation in Aerodynamics Inverse Design D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2009

Resolution
unresolved
no resolver link, observed 2026-08-03T05:00:37.896103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T05:00:37.896103Z digest=sha256:72d7e051e132eb40986d7c06b68faf10ffebd47a95a4a973f480659aa7022cd3

Observation c8d2bc5c-62e5-4b66-bc8a-af6bf541dbee · inbound

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation cites this paper.

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-05-25T07:00:26.103492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-25T07:00:01.741166Z digest=sha256:ffa344a2ac2b3cff01ce44ad38f5a15a2037f8d77612e6a514a3f2b1957d9f54

Observation a02efa69-4ede-40bb-a01d-524440790899 · inbound

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows cites this paper.

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-05-16T03:37:13.883578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-16T03:36:09.272019Z digest=sha256:ce5ad5781a0e39f5351cfccb4da50c9c458f4dff292096fc5dec6f213c77dad1

Observation eb39c09e-d1d7-408d-b62c-421242145b72 · inbound

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows cites this paper.

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T02:53:15.220023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T02:53:15.220023Z digest=sha256:3490b820310df511a9f62b3dab254b666c36a0c89167b9a5e90ce5ca2fef81d4

Observation 9994c1e3-cfea-43ac-a448-9b2ec568ecc5 · inbound

Improving Diffusion Planners by Self-Supervised Action Gating with Energies cites this paper.

Improving Diffusion Planners by Self-Supervised Action Gating with Energies D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-02T19:22:10.643647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T19:22:10.643647Z digest=sha256:ea56b2f2ae8726287ef421d8f78150055137492f47257af8f014a9bb70c30255

Observation 49fe07e8-0158-4b31-bc4c-500d4644040f · inbound

What Does Flow Matching Bring To TD Learning? cites this paper.

What Does Flow Matching Bring To TD Learning? D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 22

Resolution
metadata mismatch
local_arxiv, observed 2026-05-15T16:36:17.891180Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-15T16:32:29.432272Z digest=sha256:02ae26d0b25a111fa7cf0b8a27231aa57923520107d5a901c4ad0b6fc9efa292

Observation 0ebca3db-c17c-4070-8574-b1e1eef07451 · inbound

Offline Materials Optimization with CliqueFlowmer cites this paper.

Offline Materials Optimization with CliqueFlowmer D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-05-15T15:36:13.368034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-15T15:35:43.439664Z digest=sha256:db7969a7ba19c7d5eb80cbe0586a9f56745efebf2c582bb7d6b44c065d1c35e2

Observation f5a947da-c221-46c4-b46b-19a01174cdf6 · inbound

WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems cites this paper.

WestWorld: A Knowledge-Encoded Scalable Trajectory World Model for Diverse Robotic Systems D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-05-21T11:44:09.368937Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T11:40:28.002606Z digest=sha256:c4acb7f3d430886bfd546fce1aa0e7b100eeafaf218913b127cf811db9b0d8e0

Observation 76d88731-d32f-4c2f-a51e-9ac0178b4463 · inbound

OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration cites this paper.

OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-05-15T21:40:21.069448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-15T21:38:53.792221Z digest=sha256:a2b33b0b38e80fcda93a9102acd7d197207f2875c9da115a7c00c3d4b36c1557

Observation 1205d63e-d996-4c7f-90e1-76b626f235c8 · inbound

Genuine pair density wave order on the kagome lattice cites this paper.

Genuine pair density wave order on the kagome lattice D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-07-13T13:17:06.175932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T13:17:06.175932Z digest=sha256:a272f1596fee67b3750a5d7f0be70a65bb8bf83c3666f844d9369d8d7b8cdc33

Observation 9712c528-5430-493c-bb61-6410c676f04c · inbound

ReinVBC: A Model-based Reinforcement Learning Approach to Vehicle Braking Controller cites this paper.

ReinVBC: A Model-based Reinforcement Learning Approach to Vehicle Braking Controller D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T20:15:17.754359Z digest=sha256:1844deb2f07e212cd9b0ad15cd0a670ad6b63cfe6cc5a565489be10edd203a45

Observation e3d4369c-2edd-4654-8f6a-7a530f96f858 · inbound

GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control cites this paper.

GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T18:24:08.661669Z digest=sha256:767529b5ea32e95aadd32f9b179768395a98f5e52e8927777191c216bdff7ceb

Observation 61f24b5e-0e21-4723-ab70-4d3bf8bdecc8 · inbound

ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching cites this paper.

ScoRe-Flow: Complete Distributional Control via Score-Based Reinforcement Learning for Flow Matching D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T16:02:36.261596Z digest=sha256:c87e409dbc259fa55f19eab92e59e271aa84269b97ed9b12874585919c50443d

Observation 190e4f2f-e278-4ee9-8593-9eace7de7c56 · inbound

Fisher Decorator: Refining Flow Policy via a Local Transport Map cites this paper.

Fisher Decorator: Refining Flow Policy via a Local Transport Map D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T05:28:12.298066Z digest=sha256:fabcffc5dc9815e5c80f61d2b634caee789744a9c9fa12fc9b2f5a67292f7a00

Observation fdba2290-af2c-49d6-8d2c-e84a4fcd6e54 · inbound

DAG-STL: A Hierarchical Framework for Zero-Shot Trajectory Planning under Signal Temporal Logic Specifications cites this paper.

DAG-STL: A Hierarchical Framework for Zero-Shot Trajectory Planning under Signal Temporal Logic Specifications D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-10T03:53:37.295204Z digest=sha256:c14fa2008e137540e11f97fd82019ae5291e8b99c95ac531130a90ce81bb19a3

Observation c66bfe18-9a1c-4107-a25b-10e7dd7c5f43 · inbound

Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning cites this paper.

Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-10T00:19:48.053466Z digest=sha256:4738f7de7045844b6be8cfd5e1b6366b01cb64f0c20b339d1e02ce9b09d46e76

Observation 464a0396-f629-4e6c-b26f-4b39347c925f · inbound

Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning cites this paper.

Preserve Support, Not Correspondence: Dynamic Routing for Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-08T12:24:01.571564Z digest=sha256:460c7c744866400c490883b122cbefdd24327290cf1932c6a309079a75ba1db4

Observation a84a47fc-3a2c-4d00-9698-2d3450947a1d · inbound

When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning cites this paper.

When Policies Cannot Be Retrained: A Unified Closed-Form View of Post-Training Steering in Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-09T22:15:16.221059Z digest=sha256:ab51ebd341a7e3a51adb6e4c410015bea84dcf130cc29db189bd8e4f41e3d830

Observation 18cabee3-709c-4f69-85c7-566a74ba41d8 · inbound

A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning cites this paper.

A Reward-Free Viewpoint on Multi-Objective Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-08T04:04:19.891421Z digest=sha256:72a6076765041a8a5adb0bc96941393637c87725d4018a243cf650c4846bd24e

Observation 66f36f7c-97aa-4bc2-9122-46775a80aba1 · inbound

SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning cites this paper.

SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-08T04:01:31.928056Z digest=sha256:f34531190d21cc9536fcd8c466ba0925d958b9d042bd272c52df29a819bf3dc3

Observation 10136481-a4dd-4b07-910e-e847d1dade26 · inbound

Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B cites this paper.

Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-09T20:30:51.580075Z digest=sha256:235b53aa32d09cc98408099d09dc8f2938eeaee91d446c567b30361f9d020d33

Observation ca971361-1454-46ed-a56f-7e766c9ecb40 · inbound

Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B cites this paper.

Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-05-21T00:29:17.328144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T00:26:22.118037Z digest=sha256:13ff9b5d8ad0374e2c888bdd503667fc771be57403d0b013c94b3b7f5a8faad2

Observation 3bd84c05-6355-435e-9499-8b697f1c501c · inbound

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning cites this paper.

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 27

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-10T16:25:25.739019Z digest=sha256:d4e19a33bc98a413894885a3d186aa22c235146bb7a3e34e286165b71430c509

Observation 7fdfa13b-b218-4768-b952-242a14399073 · inbound

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning cites this paper.

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 4

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T00:45:11.861707Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-01T00:43:24.171887Z digest=sha256:387a8eb38847d2b921e8a15a506cf730dc2c42e73c90d1be4e44dd76de7cf442

Observation c43bb4b8-d90c-46e0-9218-f097d8f54369 · inbound

QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL cites this paper.

QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 50

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-11T01:17:48.643521Z digest=sha256:60187576bc7f0265ca3fcf4c3bf2547fabc1c5e9034a7d0ebfc9fc38ba75574b

Observation c17af99f-deba-4ed7-a985-9d972bd8a6ca · inbound

AdamO: A Collapse-Suppressed Optimizer for Offline RL cites this paper.

AdamO: A Collapse-Suppressed Optimizer for Offline RL D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 71

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-10T14:48:05.166453Z digest=sha256:c65ff77fa1199c0b4e50e3b3d15c201f2b74592524b4f9616903334c4db4f264

Observation cf50f462-3ba9-4e54-9f39-99c5fb671ce3 · inbound

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies cites this paper.

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 145

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-08T18:48:56.075160Z digest=sha256:af566355ad5d7fcdce36842afc9f535c901bb679ee09b1716a23fd41e0148257

Observation 7f2b5ac5-f29a-402d-86da-8695f7888a87 · inbound

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies cites this paper.

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-07-01T00:05:09.698570Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-07-01T00:02:55.449923Z digest=sha256:dd7b6f13a0981203b0617035aecb7d3f7b62be009a73f1747928e534ba2da850

Observation 24b3ba85-c884-47fe-85b1-f56cffe7dd96 · inbound

Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning cites this paper.

Adaptive Policy Selection and Fine-Tuning under Interaction Budgets for Offline-to-Online Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-08T17:17:14.300877Z digest=sha256:b970994393bc67e8443af4c2aab1436eb53b96ea34b9fe8ef38d763321f43491

Observation dc57dcd3-07fe-47ae-ae2a-e3e1efdcdcca · inbound

When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning cites this paper.

When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 61

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-08T16:34:18.603134Z digest=sha256:0294f628ade093912f28fa2b1d52cd443dc0a92bd45d5d07b59c76ed1bb78c87

Observation d828322f-2d29-4f44-a7f2-160889b7446b · inbound

When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning cites this paper.

When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-06-30T23:25:07.008761Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-30T23:24:57.811919Z digest=sha256:2b44eaddab37e8799566ad63b4a08a08d46489f86b8e6a46c456cad78a57c632

Observation b6b75675-be3b-4006-a910-0a84b22b2387 · inbound

Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer cites this paper.

Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-08T13:56:01.365382Z digest=sha256:101bd90ab473940da4f66fc29d88bdf24009855610e05a7ffd2a76669c69ee9c

Observation ff817eb7-3b28-4405-98e4-6c28d6b6c3af · inbound

Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies cites this paper.

Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-08T12:45:30.543045Z digest=sha256:1e0190e5911f98f0bbe0a8346eaa049731143d562930715e4fcb4d567e41dfb2

Observation d9ecb821-828c-4490-951c-054cff5e55d9 · inbound

Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning cites this paper.

Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 28

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-12T02:17:25.783688Z digest=sha256:8b46386e9526e2cf3bdbcb3598c7a96bdda0c6cbbf8496fb79538434bc7ae697

Observation 126dba32-4761-4544-8df1-4cb6b8e91b78 · inbound

Path-Coupled Bellman Flows for Distributional Reinforcement Learning cites this paper.

Path-Coupled Bellman Flows for Distributional Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-12T02:12:58.528130Z digest=sha256:60b7506a5b9368742a1ac5a9f9deb50612eab14db64c62f0fea2b2b2815a3d2e

Observation 674b60ee-f6a5-4472-9be6-b3ea984461eb · inbound

Muninn: Your Trajectory Diffusion Model But Faster cites this paper.

Muninn: Your Trajectory Diffusion Model But Faster D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T23:19:17.477461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-12T03:49:48.492957Z digest=sha256:c7cadb4ff9829acf1bd59f845176171fd61cc684cf9d9dc40b2b3b25cd24fd1e

Observation 5168a44a-e61d-4195-ace1-3e30d6303173 · inbound

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking cites this paper.

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-13T02:37:08.265876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-13T02:32:16.746824Z digest=sha256:6bcc2a8431aaf101058a610b337092047cd6c678f0cc329c5b76b7e0c0defba7

Observation f1b1d3b8-6b7a-49ac-9ea9-261dd9604361 · inbound

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking cites this paper.

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-21T08:54:05.820213Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-21T08:53:29.468764Z digest=sha256:484af3fe379707e4e97b79c1b8a925cc1256256bcd19508d6d42a89a9576e5f5

Observation 38465ba8-f265-4ffc-a194-0da14a4ed6a9 · inbound

Discrete Flow Matching for Offline-to-Online Reinforcement Learning cites this paper.

Discrete Flow Matching for Offline-to-Online Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 30

Resolution
metadata mismatch
local_arxiv, observed 2026-05-13T05:52:22.621567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-13T05:48:40.468890Z digest=sha256:5edb55314e1a2445369e77f50149fab50c7659b93fc9d18ad67bbe0da4b1ee4a

Observation e4d16ba0-f6d5-4fdd-a772-588d649e45a1 · inbound

Aligning Flow Map Policies with Optimal Q-Guidance cites this paper.

Aligning Flow Map Policies with Optimal Q-Guidance D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-13T05:07:17.469255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-13T05:04:22.603786Z digest=sha256:92e6f938a10e9186ef929ffb25145753aaa53aad225f450ceb37360175244ab2

Observation a5acfc70-d5e7-43e2-b95c-0f1863985a87 · inbound

Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning cites this paper.

Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-05-14T20:12:54.863399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T20:12:19.948073Z digest=sha256:ee164fe3cd5d8b13bd7897d92ea473ed577988a533ccf6c166a5a66c71339ac4

Observation f7760670-0df6-4bb9-8cf4-69235e2804c6 · inbound

Trajectory-Level Data Augmentation for Offline Reinforcement Learning cites this paper.

Trajectory-Level Data Augmentation for Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-05-14T20:09:26.246608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-14T20:08:37.905082Z digest=sha256:123d6d238aaa31be0c7cb45ef3eadf25b5fc284b6b1f44af0f92dae84a7d8182

Observation def7e9d9-865b-4986-8179-fd7c5d15688b · inbound

Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy cites this paper.

Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-05-14T19:27:51.683262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T19:26:19.032362Z digest=sha256:4373476eac564d621fe24d2c20cb84953ebecaa59f9d014e47e42e783ac74b09

Observation adfd5b49-d753-43f4-864b-8cb788035b6f · inbound

Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy cites this paper.

Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-01T14:25:46.676612Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T21:35:14.348849Z digest=sha256:8b816e4a58e774947878e641080282452c5da757946e8f393c82f0a218651faa

Observation 237d37e1-954c-4458-9241-6c3cc4ed5702 · inbound

Matrix-Space Reinforcement Learning for Reusing Local Transition Geometry cites this paper.

Matrix-Space Reinforcement Learning for Reusing Local Transition Geometry D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-05-15T02:03:28.786780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-15T02:03:11.540545Z digest=sha256:86bc0faa97f5d504661cc4243858b6bcb714c714afd12ad60083397d2861f97d

Observation d55df0e7-3ba9-46ad-80ea-eb57cb4a6040 · inbound

ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization cites this paper.

ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-05-15T01:33:27.173421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-15T01:32:42.972836Z digest=sha256:644ae829ad0f8745ffde5e29108b23533edad00746fecadad112e7cddf0adbfc

Observation 8198ffb8-9122-401a-bff6-c39122b2a403 · inbound

Peng's Q($\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning cites this paper.

Peng's Q($\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-01T14:25:45.828541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T21:45:43.298829Z digest=sha256:4b7cc7bd5997e803b8001a336bae1c457107d220015de6a75dd7afe5479a20d7

Observation 3733f407-d294-46b9-9a2f-ebebce9c9633 · inbound

Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making cites this paper.

Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 289

Resolution
verified exact
local_arxiv, observed 2026-05-20T20:59:02.182120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-20T20:54:31.025488Z digest=sha256:3a3ae444c96dcd57fd5b98d20b86333e5c0b0b6fc9908fe83a1f234bcbbd6f72

Observation 43488997-d8b8-465b-b061-0582c4de41c9 · inbound

ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization cites this paper.

ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-05-20T12:08:15.446243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-20T12:07:21.037980Z digest=sha256:787397500deb15ca099aac9537cf081eb922c4ca55b66f71a0f4182cc4febf0e

Observation 93b0f1b0-0f9c-4e52-9bae-199ba0d54173 · inbound

Planner-Admissible Graph-PDE Value Extensions for Sparse Goal-Conditioned Planning cites this paper.

Planner-Admissible Graph-PDE Value Extensions for Sparse Goal-Conditioned Planning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-05-20T11:43:15.373119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-20T11:39:11.180742Z digest=sha256:554de276cb063f84753f22c3fcc787494b0cbaea2a33ce17d1cc8b0e9e5051b0

Observation 84e4ed2a-33f8-405d-ae91-ead714c2f975 · inbound

Mechanisms of Misgeneralization in Physical Sequence Modeling cites this paper.

Mechanisms of Misgeneralization in Physical Sequence Modeling D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-05-21T07:44:48.731073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-21T07:44:37.810511Z digest=sha256:7f137825122e6601f5d6d5b43bfa6a8121143e9341a7edb40b29ea79eabe5a25

Observation 13bbe72d-86e0-46db-b225-55663de43657 · inbound

stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation cites this paper.

stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 57

Resolution
verified exact
local_arxiv, observed 2026-05-22T09:01:20.300216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-22T08:57:19.834179Z digest=sha256:bb0ccb0b94bcd98aae65be30c8a60a9c6bd421928047953d6eee38a1e95f71c0

Observation 0083e051-41b1-47bf-adc2-b36f6b49bcf1 · inbound

Target-Aligned Bellman Backup for Cross-domain Offline Reinforcement Learning cites this paper.

Target-Aligned Bellman Backup for Cross-domain Offline Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 33

Resolution
verified exact
local_arxiv, observed 2026-05-22T08:04:43.177451Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-22T08:02:27.951445Z digest=sha256:b8714209060bcfe2e1b85b858c924d49a7ac1a7c9d2f7096973c17c290e74780

Observation ef85e69b-e9fa-42b6-933e-aa3bc3ad74af · inbound

Goal-Conditioned Agents that Learn Everything All at Once cites this paper.

Goal-Conditioned Agents that Learn Everything All at Once D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 57

Resolution
metadata mismatch
local_arxiv, observed 2026-05-25T05:00:21.689776Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-05-25T04:59:48.867927Z digest=sha256:32d781e0ade57a379783fa3d3243b315596f4b64a73dd5e10b28b4dc9ce8824d

Observation 0483ddab-512c-4619-a015-6c90d733a3e4 · inbound

Nano World Models: A Minimalist Implementation of Future Video Prediction cites this paper.

Nano World Models: A Minimalist Implementation of Future Video Prediction D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-06-30T18:55:00.269724Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T18:52:29.675477Z digest=sha256:c5b214a9a321e9c3cce42459a9c737270235ffe5bbf1adc01da601a23ddf995b

Observation d993b474-5cde-4561-9112-c7cfa0d22ab6 · inbound

Neuro-Inspired Inverse Learning for Planning and Control cites this paper.

Neuro-Inspired Inverse Learning for Planning and Control D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 89

Resolution
verified exact
local_arxiv, observed 2026-06-30T16:14:53.448530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T16:07:16.957620Z digest=sha256:c362434a7be250e1023acf032a1edb31d3e824267517ce2e3d8015c451dcf82e

Observation d57e4617-eefe-4682-bab0-65e4c02a40ac · inbound

On the Stability and Realizability of Recurrent Polynomial Surrogate Ternary Logic Gate Networks cites this paper.

On the Stability and Realizability of Recurrent Polynomial Surrogate Ternary Logic Gate Networks D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-06-30T15:04:46.263955Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T15:01:45.367343Z digest=sha256:477cb1c3ad9c1beba553921ed51a2fc2b918c6a7f398b10ecaff7b5c66681f51

Observation f8673c23-e7cc-4c9e-a7e1-0eb89ca582e6 · inbound

Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning cites this paper.

Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-06-30T11:44:37.905162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-30T11:43:41.884049Z digest=sha256:8327257c437cd1ff97e582350dc8bb985c99aaaf7c82ce375e246772cb79fea0

Observation 620cc88a-f8c3-4a09-b8de-8368248bf548 · inbound

Dynamic Neural Koopman Distillation for Real-Time Robot Control Using Diffusion Models cites this paper.

Dynamic Neural Koopman Distillation for Real-Time Robot Control Using Diffusion Models D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-07-01T15:45:48.219518Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-30T01:10:47.622232Z digest=sha256:336aff0140dacd424351df55ab83b6057a39cc23c413e170118fc19c7a39987c

Observation 9bb7d4a3-abc3-43de-b545-3c4ccdbc78d5 · inbound

How to Mitigate the Distribution Shift Problem in Robotics Control: A Robust and Adaptive Approach Based on Offline to Online Imitation Learning cites this paper.

How to Mitigate the Distribution Shift Problem in Robotics Control: A Robust and Adaptive Approach Based on Offline to Online Imitation Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T22:03:59.792125Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-07-11T11:50:26.030339Z digest=sha256:3c0d25ab4e87c6799169b2a575e3740a784502063a784e59b91c68ed3d5c38c3

Observation 13412e0f-17b7-4ab5-9482-8704fa492281 · inbound

Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations cites this paper.

Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-06-29T22:04:00.642255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T21:43:59.953809Z digest=sha256:e94c428323a4883120febb63d652c6f1492e4ea26cdcd730c4a88f66fbfd554b

Observation 79c8ee20-236e-4919-a362-eb5da8c599a2 · inbound

Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning cites this paper.

Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T22:34:02.574506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T22:24:26.258621Z digest=sha256:c53f5296fe34f29ce5cc88fc04d968a5668c80a2f5a586c6ba2e6494389a18bc

Observation 2778117a-0dbd-4f99-87f7-bd8ec7e2894c · inbound

Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference cites this paper.

Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.102250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T19:17:17.682142Z digest=sha256:c01ca8c7d9925f6ba5a660e20fb65d6469b04c7010a76b8e0846703d4b3838a0

Observation 748f8126-2dba-4f68-b95e-629533aaf2f5 · inbound

SPAR: Support-Preserving Action Rectification cites this paper.

SPAR: Support-Preserving Action Rectification D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-06-29T14:43:30.969198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T14:34:39.094753Z digest=sha256:854ab685d9d058cf409e9f1422ad0cd3aef74c0a19abfeddec69d44239017e8d

Observation dda4bdf0-2a28-435e-b842-2f9e7fc58c6a · inbound

Regularized Offline Policy Optimization with Posterior Hybrid Bayesian Belief cites this paper.

Regularized Offline Policy Optimization with Posterior Hybrid Bayesian Belief D4RL: Datasets for Deep Data-Driven Reinforcement Learning

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-02T12:46:50.820790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:46:50.820790Z digest=sha256:ee40ab8be46428bef1bb29ffc39c9852638d8850df390e151222e29f4c17dff6