Pith. sign in

Paper Citation Record · LEDGER

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning

As of 23 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2412.16848.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.16848 v2

Coverage vector

measured 80 of 80 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T10:20:41.901207Z

measured 80 of 80 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

80 of 80 outbound references displayed

  • verified exact1
  • verified fuzzy60
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 235c60b1-7a27-4f37-8fc6-4d38d2e17484 · outbound

This paper cites Mastering the game of go with deep neural networks and tree search,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Mastering the game of go with deep neural networks and tree search,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.272979Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.453966Z digest=sha256:fd7a188507ad4f71af715f79563137e56fb657025f23193b1779b799715f772a

Observation dfdd9d15-9f82-4c2b-94ff-4d7718ed6eb8 · outbound

This paper cites Self-paced prioritized curriculum learning with coverage penalty in deep reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Self-paced prioritized curriculum learning with coverage penalty in deep reinforcement learning,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.257982Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.458722Z digest=sha256:6f508f19597af41497e12becfb0246e3b9f6d05071049ad600b224131d70bdac

Observation 8de036a6-6b9b-4951-a8a3-2a3e6f29b9af · outbound

This paper cites Feature control as intrinsic motivation for hierarchical reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Feature control as intrinsic motivation for hierarchical reinforcement learning,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.241886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.464843Z digest=sha256:25d62b0a9c18761e3f5a792f51b9de95d99eaed0a96000383425ba0eda12b2a1

Observation db12288f-8afd-429d-9e91-884444a7d45d · outbound

This paper cites Scalable deep reinforcement learning for vision-based robotic manipulation,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Scalable deep reinforcement learning for vision-based robotic manipulation,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.224155Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.468689Z digest=sha256:87a7b99cac2abbeea74ebe5813881b9d0dacda81d4b3be5f2d2c36a21bb6e8e0

Observation b25f2042-8169-445b-b231-8f4a454f94e2 · outbound

This paper cites Solving Rubik's Cube with a Robot Hand.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Solving Rubik's Cube with a Robot Hand

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.473307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.473307Z digest=sha256:adacea8e26f289d0f80024ee44088fc1ef40c6d583d75ebda6630987fb1b2f0c

Observation f805c780-0b8c-47cf-a48b-2ff5bec9cc7b · outbound

This paper cites Rein- forcement learning for mobile robotics exploration: A survey,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Rein- forcement learning for mobile robotics exploration: A survey,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.208222Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.478072Z digest=sha256:0b33f79a931defcd8e627d0411a37d0b1f52b71719ebd06ab23df041747d2ec4

Observation e6f386dc-8bdf-4301-9d06-fd6e6567aede · outbound

This paper cites Deductive reinforcement learning for visual autonomous urban driving navigation,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Deductive reinforcement learning for visual autonomous urban driving navigation,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.194144Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.484196Z digest=sha256:e0fcc41e2c2567d8d96a14c9c1f89b0f7d2344cf9daff9b4d886ee067032b3b2

Observation 8d2ef1ca-1939-4332-88eb-f6b11351c05b · outbound

This paper cites Deep reinforcement learning on autonomous driving policy with auxiliary critic network,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Deep reinforcement learning on autonomous driving policy with auxiliary critic network,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.183322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.488582Z digest=sha256:e30cc7fceb9795521593014d5541782769eee5f07e96caefa39aa8392930c64d

Observation 20402e7a-53b9-4296-a045-9ee6c4d676d5 · outbound

This paper cites Cadre: A cascade deep reinforcement learning framework for vision- based autonomous urban driving,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Cadre: A cascade deep reinforcement learning framework for vision- based autonomous urban driving,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.172260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.494500Z digest=sha256:4e37d88af641fba97d6065f815ad41f2d5281d21c325a4a7d8a2b28156cc16ea

Observation a1e08a39-8a21-4104-9a4b-43121234d178 · outbound

This paper cites Batch reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Batch reinforcement learning,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.161216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.499252Z digest=sha256:267a0f3968012227686aea1599380e804c2e75069c98766cf31d250ef6e06e2b

Observation 1adb127c-c337-449e-812f-6b58f4173d7c · outbound

This paper cites A survey on offline reinforcement learning: Taxonomy, review, and open problems,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning A survey on offline reinforcement learning: Taxonomy, review, and open problems,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.503745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.503745Z digest=sha256:02f133b7ebb63a1329e5790d2e66e197fc84d2ab3ede6deffae3fe2a30f85892

Observation 8be1ed71-3d5b-4728-b4a6-9485f0892005 · outbound

This paper cites Stabilizing off- policy q-learning via bootstrapping error reduction,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Stabilizing off- policy q-learning via bootstrapping error reduction,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.137841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.510710Z digest=sha256:80a0c6bd5225ce7247b0c7e987fc2ab7b4fbbffbc9e2fe033dd552081fa58a28

Observation fa8d2e8c-1b1c-4c0a-b4ea-7dd6532d82d7 · outbound

This paper cites Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.517050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.517050Z digest=sha256:9459fa1ea44eabc272a8e486e4bf5c15e0604de79583252ad826dde9595e6bc6

Observation f6d746ea-79e9-4501-93d9-5ce43ea6969c · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.523584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.523584Z digest=sha256:e7567e359772f1074c9fe8415a5b04a32f1709be8d5fba0dd7a4372deb0a9de1

Observation 06fbc69f-efd9-4eb2-a949-6b06735632aa · outbound

This paper cites Behavior Regularized Offline Reinforcement Learning.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Behavior Regularized Offline Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.528082Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.528082Z digest=sha256:4747431e750d3e97e8cd433f67f21935c52900b830817e63e1af2a8210486047

Observation e247f579-0bd7-47c5-a7de-1c4229d8c984 · outbound

This paper cites Keep doing what worked: Behavior modelling priors for offline reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Keep doing what worked: Behavior modelling priors for offline reinforcement learning,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.125435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.532849Z digest=sha256:893130632184d2e1dac0f9b0f6d34f397d8628539826da3e79ab7098bdeed64e

Observation 1736ba04-7f8e-47c0-9f6f-4e18e973f7d2 · outbound

This paper cites Off-policy deep reinforcement learning without exploration,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Off-policy deep reinforcement learning without exploration,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.113347Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.536971Z digest=sha256:75fe4ed97378c7352efcbeae9fecc0a752cbe5a251552fe89d7bc17de091ff5e

Observation 50fa9343-4f2b-44a6-af1e-b442eba14149 · outbound

This paper cites Conservative q-learning for offline reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Conservative q-learning for offline reinforcement learning,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.099058Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.541772Z digest=sha256:a80ef85038e56291c4e16f55348ae747af25a8b86aeed8fe1d19c686092192bb

Observation 0713a2ee-4465-427a-ba16-ce41f2ed975c · outbound

This paper cites Conservative data sharing for multi-task offline reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Conservative data sharing for multi-task offline reinforcement learning,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.086771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.546254Z digest=sha256:b29c81b1eee513905bb4ca57d8a33d003cca5a2c9df04c24c8979b3db059e9e7

Observation ce89ff47-312d-40e7-9562-e07c6ce222f8 · outbound

This paper cites Combo: Conservative offline model-based policy optimization,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Combo: Conservative offline model-based policy optimization,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.075723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.550553Z digest=sha256:bf309a93f87b0f72ce3419ed669397c9f7ecc55ca8464ee5369c1baa7306d0ac

Observation da643c97-f944-47d4-8105-c8d8875427c6 · outbound

This paper cites Conservative offline distribu- tional reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Conservative offline distribu- tional reinforcement learning,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.064520Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.554577Z digest=sha256:a499a836a8892c78e6a0ebb63039b63ee95ac595c37dd32ebddf30cf42fda9f0

Observation 555d7b47-69cf-4109-be6e-dca669343f9a · outbound

This paper cites Bail: Best-action imitation learning for batch deep reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Bail: Best-action imitation learning for batch deep reinforcement learning,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.052695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.558731Z digest=sha256:f4beb737807c5afd8066fa73fa37a242013e69578bd052088da6a09cf83dfc03

Observation 14585ab1-c475-483e-931a-64a09915e53e · outbound

This paper cites Critic regularized regression,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Critic regularized regression,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.037377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.563460Z digest=sha256:bc3dfcfc17caf3a90d1f775430cdb9285207097ead4b1d4f318fa4d729777983

Observation 193e2922-9f58-4333-aaa8-da27096fd3ab · outbound

This paper cites Curriculum offline imitating learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Curriculum offline imitating learning,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.018734Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.568884Z digest=sha256:d5528e91eaf6897abf768a48db20cffdfcc6edb95653a0e67584892a3314f766

Observation 22140e3c-7dea-4bcf-8f46-1bdc409b13b3 · outbound

This paper cites Issues in using function approximation for reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Issues in using function approximation for reinforcement learning,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:43.004471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.573979Z digest=sha256:46d8ea1bdce0bf830217d61cec621602acafeee430f610a1c3e622edefbc47f3

Observation 7ed2cccc-ff65-4a39-80d1-69ec5764eeeb · outbound

This paper cites Diagnosing bottlenecks in deep q-learning algorithms,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Diagnosing bottlenecks in deep q-learning algorithms,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.993397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.578438Z digest=sha256:effd647cf661a41c98af5570e5d5e5293deed68a148c4e98811cd68ec32529db

Observation aed201d5-eb30-42c8-ab43-f9147d08caa5 · outbound

This paper cites Towards Characterizing Divergence in Deep Q-Learning.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Towards Characterizing Divergence in Deep Q-Learning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.585742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.585742Z digest=sha256:87e9568fd57cd39e0fc9e13e762fed61411d8639d5e886d78efd2479a6f61201

Observation 69bd9f7f-9cb8-4de0-8067-938cafc6b7dd · outbound

This paper cites Non-delusional q-learning and value-iteration,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Non-delusional q-learning and value-iteration,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.983463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.592639Z digest=sha256:4328644b7b44ffdcaafe77dbb8112deb3edf0c1ffa1a9ef49f0c94aef3c1fd2f

Observation c8739e7e-8318-4c34-b86b-353a031027c3 · outbound

This paper cites Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.972957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.599656Z digest=sha256:e7e4e803a133aad14be9d9272a91ec0e723e07b9f8d9b0c1f95d9c141b2aa44f

Observation 705e8487-1669-40e4-b479-e29462368695 · outbound

This paper cites Addressing function approxi- mation error in actor-critic methods,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Addressing function approxi- mation error in actor-critic methods,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.961641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.605799Z digest=sha256:26cd3f700872abc93c2e75fbfc5bfe7dabd06be4bd60457cf18ea07602d52173

Observation 11afa7e7-dcf7-44fa-87e2-30edaa3d3367 · outbound

This paper cites Adaptive qq -learning for data-based optimal output regulation with experience replay,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Adaptive qq -learning for data-based optimal output regulation with experience replay,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.949657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.610146Z digest=sha256:be799aef39e45a3d9aafb6e74932d1f6e841a7f7b3ba2e3620540a3d738cf784

Observation 0cfa420d-355f-4539-ab8e-79f398d2b85a · outbound

This paper cites Prioritized Experience Replay.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Prioritized Experience Replay

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.615061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.615061Z digest=sha256:d6a93e74d8fc03af8b7da17d01f89c8d5498b94b212e35eab82260423c3f3e28

Observation 2f67bb5a-7b9f-48cc-9fba-427a0aee93cd · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Playing Atari with Deep Reinforcement Learning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.621882Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.621882Z digest=sha256:932762ee535a21eb597243bf0d4e46265b7ad68629a83f8e505c3f5a517e6e2b

Observation f36895de-dd90-429f-af4f-1077efd51bfa · outbound

This paper cites Distributed prioritized experience replay,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Distributed prioritized experience replay,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.932546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.627522Z digest=sha256:2d551aece9cb9c1a930c6895e6d219a87c1e3a2c4d71ee1ac1de11bfb27dd56e

Observation f1f36a59-4a94-4869-b409-6b0b609831ef · outbound

This paper cites An equivalence between loss functions and non-uniform sampling in experience replay,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning An equivalence between loss functions and non-uniform sampling in experience replay,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.917967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.632461Z digest=sha256:f64a8bed83362e541327109fb8295d366dce7854645d5a9c07e277acf85344ea

Observation 5cbefa5a-8d8b-4a18-97ed-c8c9b64899f7 · outbound

This paper cites Model-augmented prioritized experience replay,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Model-augmented prioritized experience replay,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.902889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.636864Z digest=sha256:058e9f15e0a36303bfd83c41e52e52581b05ffe45eb4066268fae67c1dda6da2

Observation 9612b52f-54ac-4139-a02c-3e4e877d650a · outbound

This paper cites Demystifying Reinforcement Learning in Time-Varying Systems.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Demystifying Reinforcement Learning in Time-Varying Systems

Reference 37

Resolution
verified exact
local_arxiv, observed 2026-08-11T10:20:42.107881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.647785Z digest=sha256:47c7da5f3f74f88fd457ef3d44969f59186caceb681bc4220d434e1e67378486

Observation 672dc61d-8d84-43b6-8e05-3cf3bc4f5b1a · outbound

This paper cites Towards continual reinforcement learning: A review and perspectives,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Towards continual reinforcement learning: A review and perspectives,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.889697Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.653727Z digest=sha256:e6aebb51cab97222394d9f49e07b8575ac5310ed07ff3b36f72d1cec32e1b0e3

Observation 767cd7da-3e4b-4ec3-9ca6-306eb626a448 · outbound

This paper cites Pseudo- rehearsal: Achieving deep reinforcement learning without catastrophic forgetting,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Pseudo- rehearsal: Achieving deep reinforcement learning without catastrophic forgetting,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.878701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.657860Z digest=sha256:816fb3e35bdaa735e1deb7ff29fd7ccf9a16ae1ae2ad13a3affbabe8209f8c70

Observation ce6d6447-4429-4c24-9de1-43d07e919041 · outbound

This paper cites Under- standing the impact of entropy on policy optimization,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Under- standing the impact of entropy on policy optimization,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.862612Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.662434Z digest=sha256:39ef800e92a654c029a2e2b4ad30236150e10832f1707b799d8276c8620cbb43

Observation b3049bf6-5910-4679-b4a1-0e0c75349801 · outbound

This paper cites Offline reinforcement learning with implicit q-learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Offline reinforcement learning with implicit q-learning,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.848172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.670022Z digest=sha256:6c064c4c5a607a5d42c42d32a6e3f1728cd074d41851e6624f1d28201f97f03c

Observation 254499a5-58f1-44ea-b094-642718decc2c · outbound

This paper cites Monotonic quantile network for worst-case offline reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Monotonic quantile network for worst-case offline reinforcement learning,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.821851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.677120Z digest=sha256:1c043276f5e5429f054401cd1bbbf1bd62cbe06b5399a2247bafef8a99434680

Observation 6a521abc-f9b7-4a8c-8d51-deaeb70994ea · outbound

This paper cites Mild policy evaluation for offline actor–critic,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Mild policy evaluation for offline actor–critic,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.802096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.686225Z digest=sha256:d00131b7246bde41e9244754e360b716d07de814b7359970ac7c9003191dd7a0

Observation 9b1aa0a2-89b5-4c00-b1fe-a64778406f1a · outbound

This paper cites Plas: Latent action space for offline reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Plas: Latent action space for offline reinforcement learning,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.786108Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.691300Z digest=sha256:302642f599e793b958150a3df1210cf584bf35816f1a021f61cb56017fb2bac3

Observation 93f6a1e6-2fc9-4009-8b77-8c92d1cbe2b2 · outbound

This paper cites Offline re- inforcement learning with fisher divergence critic regularization,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Offline re- inforcement learning with fisher divergence critic regularization,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.771233Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.696363Z digest=sha256:80d4bf4639393105ebf29ab07bb94de9c9c854bfee2cc6246fff17f25073a847

Observation 5cab6046-fd92-4aeb-b32b-ffa60db29e85 · outbound

This paper cites A minimalist approach to offline reinforce- ment learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning A minimalist approach to offline reinforce- ment learning,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.754517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.701076Z digest=sha256:8a5bf7e8bd163aa95a351fa75f89c722e66d98b34fbd9d41413a888e10a3baf6

Observation ed97ed5c-5052-4387-b2c6-4e69babe4d73 · outbound

This paper cites An emphatic approach to the problem of off-policy temporal-difference learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning An emphatic approach to the problem of off-policy temporal-difference learning,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.738232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.705949Z digest=sha256:082aaeb25114cff4de7e7b6e71219731dd9068fcd8dce7d91d8e66bbf0fa0415

Observation 5a490ac3-3716-4082-b839-5b668d699a9a · outbound

This paper cites AlgaeDICE: Policy Gradient from Arbitrary Experience.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning AlgaeDICE: Policy Gradient from Arbitrary Experience

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.710374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.710374Z digest=sha256:8604f31dc9f8be7b32bda0ec7f268e9d7bcf858c6c233386a60be8018494d160

Observation 541808ba-a711-488d-90d7-f249620443ae · outbound

This paper cites AWAC: Accelerating Online Reinforcement Learning with Offline Datasets.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning AWAC: Accelerating Online Reinforcement Learning with Offline Datasets

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.715755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.715755Z digest=sha256:d0a5aaf019f218e6e3e725b87d83ef687d5bc22e6bd7973a7e4c8c09f34e3a2d

Observation 73c47f21-f045-4efe-bf44-27de5bc11b19 · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.720049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.720049Z digest=sha256:1c305ddf02073b83c7e9d40cf70de5da762b81bbc0f5f9c01495d2eaeb0eed99

Observation 47ed3831-d768-40ce-999d-baef74418efb · outbound

This paper cites Safe policy improvement with an estimated baseline policy,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Safe policy improvement with an estimated baseline policy,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.717704Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.724801Z digest=sha256:ef4703c6836dbabedc00c96153ab1688d29740411b49d9e0bec6c7bd197d2934

Observation dad1690d-e67f-4f54-ac3b-b726d033ab6e · outbound

This paper cites An optimistic perspec- tive on offline reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning An optimistic perspec- tive on offline reinforcement learning,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.695468Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.728867Z digest=sha256:1be3eeca3d5923190dfe5d310c0bb96c5be8cab068433a3856e0cb22d0f90735

Observation 18a22e3b-b762-4a24-bb5e-80cd10656329 · outbound

This paper cites S4rl: Surprisingly simple self- supervision for offline reinforcement learning in robotics,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning S4rl: Surprisingly simple self- supervision for offline reinforcement learning in robotics,

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.676761Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.734016Z digest=sha256:acb6a7b41689bd30339d92cf5e4b9b34c44bc6063933e0560ec2c7de6e90c6b6

Observation d7fa561e-e905-42e9-ab34-4a89264a1b8e · outbound

This paper cites Offline rl without off-policy evaluation,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Offline rl without off-policy evaluation,

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.658956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.738135Z digest=sha256:5513d640c15f7e60f00111476f4ce91e5e21ef2a687df1236e0961b3f45cf5d6

Observation b35b240d-a462-4756-8444-40ff5f863a1f · outbound

This paper cites Offline reinforcement learning as one big sequence modeling problem,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Offline reinforcement learning as one big sequence modeling problem,

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.644273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.742125Z digest=sha256:7865eede19d11271966e2aa2b84b35ac2c6ffa2186685ca0c012dcce659b4510

Observation 54e31358-01ff-4a07-a407-1eab4d30af00 · outbound

This paper cites Decision transformer: Reinforcement learning via sequence modeling,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Decision transformer: Reinforcement learning via sequence modeling,

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.621688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.746577Z digest=sha256:bd89429784cfbf73c268714c1cbff72323ef00d5ef01bbfa3e28b92770cbb0ac

Observation ae7dcb9e-99ae-42ca-a716-b3a7a983aa05 · outbound

This paper cites Attention is all you need,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Attention is all you need,

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.756293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.756293Z digest=sha256:77a22f3ab4ca0e78298aae8db18545d322545bead8e6e0c6a97c4d0798ba9263

Observation e1df9141-9012-4747-806c-9d0e54530508 · outbound

This paper cites Hundreds guide millions: Adaptive offline reinforcement learning with expert guidance,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Hundreds guide millions: Adaptive offline reinforcement learning with expert guidance,

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.595317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.760891Z digest=sha256:fb201bdf56e30d8d0b1f5b53bd5c6caf0257d9ff460227bb0ccf37bbcb0ec382

Observation 0196fc0a-8a7e-4e74-81c2-a4a5369ae92f · outbound

This paper cites When to trust your model: Model-based policy optimization,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning When to trust your model: Model-based policy optimization,

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.580641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.773035Z digest=sha256:0fe628080d7bff7f69b74f11ef7e966bfa00cca2a7c63ea2efaa911d9f0bc842

Observation 3e182e6b-f71e-46a8-bb2c-522e9637557f · outbound

This paper cites Morel: Model-based offline reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Morel: Model-based offline reinforcement learning,

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.562204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.777931Z digest=sha256:2a2b799deb4aa2424461f00bc09580338359130b4f357551bc66cc58ff4c5014

Observation ac1efbb6-959d-41f9-af68-6f42f61064b5 · outbound

This paper cites Mopo: Model-based offline policy optimization,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Mopo: Model-based offline policy optimization,

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.541462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.782731Z digest=sha256:2769d62b53fcaf44541a1ccff6ba44706e9914f86fda9e67a68e395b5d9ed9d2

Observation 464d5d27-c0f5-4b6b-a00d-c4f711e32e55 · outbound

This paper cites Deployment-efficient reinforcement learning via model-based offline optimization,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Deployment-efficient reinforcement learning via model-based offline optimization,

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.523716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.786782Z digest=sha256:9e1ae2a7cc4d2a9cd890cd7866e15406504b5d6b11a23ac548d3a04343310205

Observation c949a1f1-dfe9-442b-b700-b029becd25fd · outbound

This paper cites Agnostic system identification for model- based reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Agnostic system identification for model- based reinforcement learning,

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.511346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.792834Z digest=sha256:29cc48844ebd970111c8a12abfb035d658bd0af0c470f4ba3dd17ebd750a2f75

Observation 0750ce75-a3e2-4eac-b255-041a0844acd3 · outbound

This paper cites Synthesis and stabilization of complex behaviors through online trajectory optimization,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Synthesis and stabilization of complex behaviors through online trajectory optimization,

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.488480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.799027Z digest=sha256:292da3e4056f0714da4847b5d917c5adffbfb1bd959a00c355043e736fa3a83b

Observation b83b006e-6a47-4a97-b4b3-88496825af52 · outbound

This paper cites A survey of monte carlo tree search methods,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning A survey of monte carlo tree search methods,

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.472278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.806496Z digest=sha256:54499e973ad533d09f54128bc00e4fa191fab499786261d3cb66c984fda63524

Observation e5e23dc8-9c61-4eca-8f3b-be61c896e3d9 · outbound

This paper cites Near-optimal regret bounds for reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Near-optimal regret bounds for reinforcement learning,

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.453522Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.812481Z digest=sha256:a3a2d44c2fa6e9b02f1e3d37675288f986526fffb3a90706516124c2b0c2ac15

Observation bf9156e5-3646-4a9f-ac3c-a83fc7bdcc34 · outbound

This paper cites Deep exploration via bootstrapped dqn,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Deep exploration via bootstrapped dqn,

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.428736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.818138Z digest=sha256:b717d93b40f055f0b8a8d9e8c504c1811d2e579f7cde47652538fe9e3ee582a5

Observation a06c13aa-1ede-4dbb-af80-10cfe8f6a11d · outbound

This paper cites Semi-supervised classification with graph convolutional networks,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Semi-supervised classification with graph convolutional networks,

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.825283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.825283Z digest=sha256:73f7e51737d72fcfd4c9470dd5c84dab5e4d9ecd8f00453a9597a35f4cf39560

Observation b1f40be4-19a9-4df4-9c75-102fda8a9fd9 · outbound

This paper cites Deep Learning using Rectified Linear Units (ReLU).

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Deep Learning using Rectified Linear Units (ReLU)

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.830698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.830698Z digest=sha256:513bbc213eacbbeccbbec20297110121e2fc5dcf361e1471fa3e6d50f664de92

Observation 6ef72819-0e7d-4caf-abac-f05f95eab1f9 · outbound

This paper cites D4rl: Datasets for deep data-driven reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning D4rl: Datasets for deep data-driven reinforcement learning,

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.836252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.836252Z digest=sha256:fdd01a093defbe0a33a2d8b9a40623ca5f40bd97370f72a39675d468a679b9ce

Observation 4cd85f12-5e18-43f0-bc55-655bdc2ce90f · outbound

This paper cites Mujoco: A physics engine for model-based control,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Mujoco: A physics engine for model-based control,

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.387727Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.845581Z digest=sha256:d9915c560fc503d8d6efc95205f4c363bad6366bb9b0c72792bb035720dc7e5b

Observation 574e91e4-306d-44de-89a2-4996866dbcf3 · outbound

This paper cites OpenAI Gym.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning OpenAI Gym

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.850772Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.850772Z digest=sha256:6ed3eb4775abe674e54c4b2e0c6e2b900d81aa84e607337699e0ed5cc6bee14c

Observation af6916ec-8898-4c75-8cc9-c81d9a8a56ce · outbound

This paper cites Learning complex dexterous manipulation with deep reinforcement learning and demonstrations,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Learning complex dexterous manipulation with deep reinforcement learning and demonstrations,

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.375866Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.858111Z digest=sha256:7850a1c07d5728095df3da279100820a810d01eebee9b9511e02b0788ad97b1b

Observation 8c6bc3c8-eed9-4a2a-a55f-fef9217f70e2 · outbound

This paper cites Alvinn: An autonomous land vehicle in a neural network,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Alvinn: An autonomous land vehicle in a neural network,

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.361770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.867136Z digest=sha256:09b6ac79486ab1fc2dd06a45a9119c237ce7aad28932aace964101f945ecee44

Observation 53840c34-4bc8-42df-acb7-f53d277e0c31 · outbound

This paper cites Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.874088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.874088Z digest=sha256:6a2cec25f37536b7ba0e454f6ae1fcfebc82dacef229a3f70160dabcc2347e2a

Observation 5e27b303-fd48-4f7a-ab0e-5f3104b3219b · outbound

This paper cites A Workflow for Offline Model-Free Robotic Reinforcement Learning.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning A Workflow for Offline Model-Free Robotic Reinforcement Learning

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.880729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.880729Z digest=sha256:0a0aaf23c2e942a7a14428b9ff8ed5adf7859554501990ea525273664ca4c377

Observation 548014ce-ca7f-43a7-892d-8c1afd42e30c · outbound

This paper cites Relay pol- icy learning: Solving long horizon tasks via imitation and reinforcement learning,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Relay pol- icy learning: Solving long horizon tasks via imitation and reinforcement learning,

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.344721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.884813Z digest=sha256:bf64cda317b72ff673bdd62ac5c8ecf8adcf550a5271e9327ef0ce0b508e7d5c

Observation 2ae1ff18-92e9-4440-b0d7-55972b6bcb1e · outbound

This paper cites an unresolved cited work.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Unresolved cited work

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-11T10:20:41.891069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T10:20:41.891069Z digest=sha256:5ebe4fc750d2f2688f7b219ec1b9efe68edb483b2f41fc35e70ea6f2200660d2

Observation 160307f8-775d-4ca5-8bd4-3c94906f7760 · outbound

This paper cites Stability analysis of discrete-time infinite-horizon optimal control with discounted cost,.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning Stability analysis of discrete-time infinite-horizon optimal control with discounted cost,

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.313359Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.895075Z digest=sha256:dd44390d4d6d3d871302d326198f74a148891a3db932d6cc7a026a6964bd5d44

Observation 3af05d7b-1290-4ff3-a114-3b8248558388 · outbound

This paper cites >" to " <.

ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning >" to " <

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T10:20:42.293002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-11T10:20:41.901207Z digest=sha256:34b7b63f412e4b981de5efaf7228cda38451a0a10de4a10f0ac34b0caba89e2d

Pith citing papers

No inbound Pith citation observations are available.