{"as_of":"2026-08-23T20:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7482facc5e375b56f7fa7830b1951c852b81979ba019b7cdb5dd296b2184ca88","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:20:41.901207Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.16848/citation-record","integrity":"/paper/2412.16848/integrity","json":"/paper/2412.16848/citation-record.json","paper":"/paper/2412.16848"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.268231Z","title":"Mastering the game of go with deep neural networks and tree search,","venue":null,"work_id":"e1bec740-bc75-4a11-b9b6-f846c455a93e","year":2016},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.453966Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:fd7a188507ad4f71af715f79563137e56fb657025f23193b1779b799715f772a","observation_id":"235c60b1-7a27-4f37-8fc6-4d38d2e17484","resolution":{"observed_at":"2026-08-11T10:20:43.272979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.250381Z","title":"Self-paced prioritized curriculum learning with coverage penalty in deep reinforcement learning,","venue":null,"work_id":"5e59b81b-90e1-4c82-89d6-856742c404a9","year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.458722Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:6f508f19597af41497e12becfb0246e3b9f6d05071049ad600b224131d70bdac","observation_id":"dfdd9d15-9f82-4c2b-94ff-4d7718ed6eb8","resolution":{"observed_at":"2026-08-11T10:20:43.257982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.237799Z","title":"Feature control as intrinsic motivation for hierarchical reinforcement learning,","venue":null,"work_id":"7c2973b9-a888-47f5-85b3-c2eba97e8316","year":2019},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.464843Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:25d62b0a9c18761e3f5a792f51b9de95d99eaed0a96000383425ba0eda12b2a1","observation_id":"8de036a6-6b9b-4951-a8a3-2a3e6f29b9af","resolution":{"observed_at":"2026-08-11T10:20:43.241886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.218727Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation,","venue":null,"work_id":"95ec5695-99da-4524-a22e-0d78969d22a8","year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.468689Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:87a7b99cac2abbeea74ebe5813881b9d0dacda81d4b3be5f2d2c36a21bb6e8e0","observation_id":"db12288f-8afd-429d-9e91-884444a7d45d","resolution":{"observed_at":"2026-08-11T10:20:43.224155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-11T10:20:41.473307Z","title":"Solving rubik’s cube with a robot hand,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.473307Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:adacea8e26f289d0f80024ee44088fc1ef40c6d583d75ebda6630987fb1b2f0c","observation_id":"b25f2042-8169-445b-b231-8f4a454f94e2","resolution":{"observed_at":"2026-08-11T10:20:41.473307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.202618Z","title":"Rein- forcement learning for mobile robotics exploration: A survey,","venue":null,"work_id":"18535d0e-312e-4847-8d3e-e41ca33d8803","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.478072Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:0b33f79a931defcd8e627d0411a37d0b1f52b71719ebd06ab23df041747d2ec4","observation_id":"f805c780-0b8c-47cf-a48b-2ff5bec9cc7b","resolution":{"observed_at":"2026-08-11T10:20:43.208222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.190181Z","title":"Deductive reinforcement learning for visual autonomous urban driving navigation,","venue":null,"work_id":"7942050e-303a-4ddb-aeec-d5aeb6f6a2ca","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.484196Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:e0fcc41e2c2567d8d96a14c9c1f89b0f7d2344cf9daff9b4d886ee067032b3b2","observation_id":"e6f386dc-8bdf-4301-9d06-fd6e6567aede","resolution":{"observed_at":"2026-08-11T10:20:43.194144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.179131Z","title":"Deep reinforcement learning on autonomous driving policy with auxiliary critic network,","venue":null,"work_id":"8040cc03-981c-4154-8dac-8d0cf3e67116","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.488582Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:e30cc7fceb9795521593014d5541782769eee5f07e96caefa39aa8392930c64d","observation_id":"8d2ef1ca-1939-4332-88eb-f6b11351c05b","resolution":{"observed_at":"2026-08-11T10:20:43.183322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.168537Z","title":"Cadre: A cascade deep reinforcement learning framework for vision- based autonomous urban driving,","venue":null,"work_id":"2db4a760-bfd6-496e-b74d-1a60af886002","year":2022},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.494500Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:4e37d88af641fba97d6065f815ad41f2d5281d21c325a4a7d8a2b28156cc16ea","observation_id":"20402e7a-53b9-4296-a045-9ee6c4d676d5","resolution":{"observed_at":"2026-08-11T10:20:43.172260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.157437Z","title":"Batch reinforcement learning,","venue":null,"work_id":"4be3f031-2cfd-40e4-a617-70fad65022a7","year":2012},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.499252Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:267a0f3968012227686aea1599380e804c2e75069c98766cf31d250ef6e06e2b","observation_id":"a1e08a39-8a21-4104-9a4b-43121234d178","resolution":{"observed_at":"2026-08-11T10:20:43.161216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:41.503745Z","title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.503745Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:02f133b7ebb63a1329e5790d2e66e197fc84d2ab3ede6deffae3fe2a30f85892","observation_id":"1adb127c-c337-449e-812f-6b58f4173d7c","resolution":{"observed_at":"2026-08-11T10:20:41.503745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.133118Z","title":"Stabilizing off- policy q-learning via bootstrapping error reduction,","venue":null,"work_id":"a819b358-d13a-47bf-be66-c89a5ccfe861","year":2019},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.510710Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:80a0c6bd5225ce7247b0c7e987fc2ab7b4fbbffbc9e2fe033dd552081fa58a28","observation_id":"8be1ed71-3d5b-4728-b4a6-9485f0892005","resolution":{"observed_at":"2026-08-11T10:20:43.137841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-08-21T15:57:22.153221Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-11T10:20:41.517050Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.517050Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:9459fa1ea44eabc272a8e486e4bf5c15e0604de79583252ad826dde9595e6bc6","observation_id":"fa8d2e8c-1b1c-4c0a-b4ea-7dd6532d82d7","resolution":{"observed_at":"2026-08-11T10:20:41.517050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-08-14T02:56:45.044088Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-11T10:20:41.523584Z","title":"Way off-policy batch deep reinforce- ment learning of implicit human preferences in dialog,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.523584Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:e7567e359772f1074c9fe8415a5b04a32f1709be8d5fba0dd7a4372deb0a9de1","observation_id":"f6d746ea-79e9-4501-93d9-5ce43ea6969c","resolution":{"observed_at":"2026-08-11T10:20:41.523584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-11T10:20:41.528082Z","title":"Behavior regularized offline reinforcement learning,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.528082Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:4747431e750d3e97e8cd433f67f21935c52900b830817e63e1af2a8210486047","observation_id":"06fbc69f-efd9-4eb2-a949-6b06735632aa","resolution":{"observed_at":"2026-08-11T10:20:41.528082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.121648Z","title":"Keep doing what worked: Behavior modelling priors for offline reinforcement learning,","venue":null,"work_id":"5d9a262e-35e4-42c1-8fc0-1f3b89a49fb4","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.532849Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:893130632184d2e1dac0f9b0f6d34f397d8628539826da3e79ab7098bdeed64e","observation_id":"e247f579-0bd7-47c5-a7de-1c4229d8c984","resolution":{"observed_at":"2026-08-11T10:20:43.125435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.108552Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":"04a58b2f-5772-4609-834d-30dba5925169","year":2019},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.536971Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:75fe4ed97378c7352efcbeae9fecc0a752cbe5a251552fe89d7bc17de091ff5e","observation_id":"1736ba04-7f8e-47c0-9f6f-4e18e973f7d2","resolution":{"observed_at":"2026-08-11T10:20:43.113347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.094600Z","title":"Conservative q-learning for offline reinforcement learning,","venue":null,"work_id":"1f1ae6b9-301a-4ec7-864e-8b77a3129d96","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.541772Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:a80ef85038e56291c4e16f55348ae747af25a8b86aeed8fe1d19c686092192bb","observation_id":"50fa9343-4f2b-44a6-af1e-b442eba14149","resolution":{"observed_at":"2026-08-11T10:20:43.099058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.083138Z","title":"Conservative data sharing for multi-task offline reinforcement learning,","venue":null,"work_id":"088662e0-5c0f-4fd4-a9c8-8a8a2b148738","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.546254Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:b29c81b1eee513905bb4ca57d8a33d003cca5a2c9df04c24c8979b3db059e9e7","observation_id":"0713a2ee-4465-427a-ba16-ce41f2ed975c","resolution":{"observed_at":"2026-08-11T10:20:43.086771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.071834Z","title":"Combo: Conservative offline model-based policy optimization,","venue":null,"work_id":"d6c6b924-4c36-4000-94b2-5d1c1bbff67f","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.550553Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:bf309a93f87b0f72ce3419ed669397c9f7ecc55ca8464ee5369c1baa7306d0ac","observation_id":"ce89ff47-312d-40e7-9562-e07c6ce222f8","resolution":{"observed_at":"2026-08-11T10:20:43.075723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.059896Z","title":"Conservative offline distribu- tional reinforcement learning,","venue":null,"work_id":"fe8c3ad7-e884-4739-b540-ea47590a1dad","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.554577Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:a499a836a8892c78e6a0ebb63039b63ee95ac595c37dd32ebddf30cf42fda9f0","observation_id":"da643c97-f944-47d4-8105-c8d8875427c6","resolution":{"observed_at":"2026-08-11T10:20:43.064520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.047432Z","title":"Bail: Best-action imitation learning for batch deep reinforcement learning,","venue":null,"work_id":"29195a47-6efb-4175-bc4a-a6792d3da509","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.558731Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:f4beb737807c5afd8066fa73fa37a242013e69578bd052088da6a09cf83dfc03","observation_id":"555d7b47-69cf-4109-be6e-dca669343f9a","resolution":{"observed_at":"2026-08-11T10:20:43.052695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.032615Z","title":"Critic regularized regression,","venue":null,"work_id":"88b03cd6-d3ec-4a5c-8f7d-417c4ed8ea83","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.563460Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:bc3dfcfc17caf3a90d1f775430cdb9285207097ead4b1d4f318fa4d729777983","observation_id":"14585ab1-c475-483e-931a-64a09915e53e","resolution":{"observed_at":"2026-08-11T10:20:43.037377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.012426Z","title":"Curriculum offline imitating learning,","venue":null,"work_id":"27392071-00af-477a-9dc0-eb315fda462b","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.568884Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:d5528e91eaf6897abf768a48db20cffdfcc6edb95653a0e67584892a3314f766","observation_id":"193e2922-9f58-4333-aaa8-da27096fd3ab","resolution":{"observed_at":"2026-08-11T10:20:43.018734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:43.000460Z","title":"Issues in using function approximation for reinforcement learning,","venue":null,"work_id":"948df0ab-c6c8-4c43-9e41-1899e7e75505","year":1993},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.573979Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:46d8ea1bdce0bf830217d61cec621602acafeee430f610a1c3e622edefbc47f3","observation_id":"22140e3c-7dea-4bcf-8f46-1bdc409b13b3","resolution":{"observed_at":"2026-08-11T10:20:43.004471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.989848Z","title":"Diagnosing bottlenecks in deep q-learning algorithms,","venue":null,"work_id":"759f6a9f-2575-4e17-94e6-0fcd4f93d4fc","year":2019},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.578438Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:effd647cf661a41c98af5570e5d5e5293deed68a148c4e98811cd68ec32529db","observation_id":"7ed2cccc-ff65-4a39-80d1-69ec5764eeeb","resolution":{"observed_at":"2026-08-11T10:20:42.993397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08894","last_updated":"2019-03-21T09:42:41Z","snapshot_observed_at":"2026-08-14T16:58:58.123236Z","submitted_at":"2019-03-21T09:42:41Z","title":"Towards Characterizing Divergence in Deep Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08894","snapshot_observed_at":"2026-08-11T10:20:41.585742Z","title":"Towards characterizing divergence in deep q-learning,","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.585742Z"},"links":{"cited_paper":"/paper/1903.08894","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:87e9568fd57cd39e0fc9e13e762fed61411d8639d5e886d78efd2479a6f61201","observation_id":"aed201d5-eb30-42c8-ab43-f9147d08caa5","resolution":{"observed_at":"2026-08-11T10:20:41.585742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.980063Z","title":"Non-delusional q-learning and value-iteration,","venue":null,"work_id":"becdc994-4875-4518-8d8c-94739ed1ebe0","year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.592639Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:4328644b7b44ffdcaafe77dbb8112deb3edf0c1ffa1a9ef49f0c94aef3c1fd2f","observation_id":"69bd9f7f-9cb8-4de0-8067-938cafc6b7dd","resolution":{"observed_at":"2026-08-11T10:20:42.983463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.968985Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"bb79bbc2-7447-4509-bc0e-fd60d43862ca","year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.599656Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:e7e4e803a133aad14be9d9272a91ec0e723e07b9f8d9b0c1f95d9c141b2aa44f","observation_id":"c8739e7e-8318-4c34-b86b-353a031027c3","resolution":{"observed_at":"2026-08-11T10:20:42.972957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.957318Z","title":"Addressing function approxi- mation error in actor-critic methods,","venue":null,"work_id":"07411db7-b145-4a90-90b4-2ea955e2f302","year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.605799Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:26cd3f700872abc93c2e75fbfc5bfe7dabd06be4bd60457cf18ea07602d52173","observation_id":"705e8487-1669-40e4-b479-e29462368695","resolution":{"observed_at":"2026-08-11T10:20:42.961641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.942828Z","title":"Adaptive qq -learning for data-based optimal output regulation with experience replay,","venue":null,"work_id":"705adf11-916b-4eb7-b584-202e28d70050","year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.610146Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:be799aef39e45a3d9aafb6e74932d1f6e841a7f7b3ba2e3620540a3d738cf784","observation_id":"11afa7e7-dcf7-44fa-87e2-30edaa3d3367","resolution":{"observed_at":"2026-08-11T10:20:42.949657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-21T06:19:51.244525Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-11T10:20:41.615061Z","title":"Prioritized experience replay,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.615061Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:d6a93e74d8fc03af8b7da17d01f89c8d5498b94b212e35eab82260423c3f3e28","observation_id":"0cfa420d-355f-4539-ab8e-79f398d2b85a","resolution":{"observed_at":"2026-08-11T10:20:41.615061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-17T17:19:33.060917Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-11T10:20:41.621882Z","title":"Playing atari with deep reinforcement learn- ing,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.621882Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:932762ee535a21eb597243bf0d4e46265b7ad68629a83f8e505c3f5a517e6e2b","observation_id":"2f67bb5a-7b9f-48cc-9fba-427a0aee93cd","resolution":{"observed_at":"2026-08-11T10:20:41.621882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.927077Z","title":"Distributed prioritized experience replay,","venue":null,"work_id":"7b772b9f-a5af-4fb0-b665-8a319a662888","year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.627522Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:2d551aece9cb9c1a930c6895e6d219a87c1e3a2c4d71ee1ac1de11bfb27dd56e","observation_id":"f36895de-dd90-429f-af4f-1077efd51bfa","resolution":{"observed_at":"2026-08-11T10:20:42.932546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.912698Z","title":"An equivalence between loss functions and non-uniform sampling in experience replay,","venue":null,"work_id":"b5bfc538-86b7-4125-b0b2-b750d61f8b4e","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.632461Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:f64a8bed83362e541327109fb8295d366dce7854645d5a9c07e277acf85344ea","observation_id":"f1f36a59-4a94-4869-b409-6b0b609831ef","resolution":{"observed_at":"2026-08-11T10:20:42.917967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.898066Z","title":"Model-augmented prioritized experience replay,","venue":null,"work_id":"a9d7a511-5d58-44d8-9c0b-a79de5f55b32","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.636864Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:058e9f15e0a36303bfd83c41e52e52581b05ffe45eb4066268fae67c1dda6da2","observation_id":"5cbefa5a-8d8b-4a18-97ed-c8c9b64899f7","resolution":{"observed_at":"2026-08-11T10:20:42.902889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05560","last_updated":"2023-01-26T23:45:19Z","snapshot_observed_at":"2026-08-16T17:28:18.257598Z","submitted_at":"2022-01-14T17:04:11Z","title":"Demystifying Reinforcement Learning in Time-Varying Systems","version":2},"cited_work":{"arxiv_id":"2201.05560","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.05560","snapshot_observed_at":"2026-08-11T10:20:42.096723Z","title":"Demystifying Reinforcement Learning in Time-Varying Systems","venue":"cs.LG","work_id":"be8aa36d-0f5d-42e4-aaa0-f4aa89c1df52","year":2022},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.647785Z"},"links":{"cited_paper":"/paper/2201.05560","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:47c7da5f3f74f88fd457ef3d44969f59186caceb681bc4220d434e1e67378486","observation_id":"9612b52f-54ac-4139-a02c-3e4e877d650a","resolution":{"observed_at":"2026-08-11T10:20:42.107881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.885798Z","title":"Towards continual reinforcement learning: A review and perspectives,","venue":null,"work_id":"7011583f-cbde-4970-8344-b7d84ee60244","year":2022},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.653727Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:e6aebb51cab97222394d9f49e07b8575ac5310ed07ff3b36f72d1cec32e1b0e3","observation_id":"672dc61d-8d84-43b6-8e05-3cf3bc4f5b1a","resolution":{"observed_at":"2026-08-11T10:20:42.889697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.871927Z","title":"Pseudo- rehearsal: Achieving deep reinforcement learning without catastrophic forgetting,","venue":null,"work_id":"c4339685-5cc0-4b27-b143-522a778aceba","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.657860Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:816fb3e35bdaa735e1deb7ff29fd7ccf9a16ae1ae2ad13a3affbabe8209f8c70","observation_id":"767cd7da-3e4b-4ec3-9ca6-306eb626a448","resolution":{"observed_at":"2026-08-11T10:20:42.878701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.856034Z","title":"Under- standing the impact of entropy on policy optimization,","venue":null,"work_id":"307e9a79-2361-4837-8672-d59e2e90add0","year":2019},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.662434Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:39ef800e92a654c029a2e2b4ad30236150e10832f1707b799d8276c8620cbb43","observation_id":"ce6d6447-4429-4c24-9de1-43d07e919041","resolution":{"observed_at":"2026-08-11T10:20:42.862612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.843327Z","title":"Offline reinforcement learning with implicit q-learning,","venue":null,"work_id":"7586805f-150d-40df-8c99-5dec2e4c042e","year":2022},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.670022Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:6c064c4c5a607a5d42c42d32a6e3f1728cd074d41851e6624f1d28201f97f03c","observation_id":"b3049bf6-5910-4679-b4a1-0e0c75349801","resolution":{"observed_at":"2026-08-11T10:20:42.848172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.815402Z","title":"Monotonic quantile network for worst-case offline reinforcement learning,","venue":null,"work_id":"02483b1f-802d-4c13-bb28-1d9b0e3e92ee","year":2022},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.677120Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:1c043276f5e5429f054401cd1bbbf1bd62cbe06b5399a2247bafef8a99434680","observation_id":"254499a5-58f1-44ea-b094-642718decc2c","resolution":{"observed_at":"2026-08-11T10:20:42.821851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.795118Z","title":"Mild policy evaluation for offline actor–critic,","venue":null,"work_id":"b8caa0bf-e925-4ad8-990f-53a1c1532d47","year":2023},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.686225Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:d00131b7246bde41e9244754e360b716d07de814b7359970ac7c9003191dd7a0","observation_id":"6a521abc-f9b7-4a8c-8d51-deaeb70994ea","resolution":{"observed_at":"2026-08-11T10:20:42.802096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.781164Z","title":"Plas: Latent action space for offline reinforcement learning,","venue":null,"work_id":"03afb9aa-a9ca-4309-bdea-a24a79da8448","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.691300Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:302642f599e793b958150a3df1210cf584bf35816f1a021f61cb56017fb2bac3","observation_id":"9b1aa0a2-89b5-4c00-b1fe-a64778406f1a","resolution":{"observed_at":"2026-08-11T10:20:42.786108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.766511Z","title":"Offline re- inforcement learning with fisher divergence critic regularization,","venue":null,"work_id":"2cb4be04-585e-4abf-a725-a4934d7a18ce","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.696363Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:80d4bf4639393105ebf29ab07bb94de9c9c854bfee2cc6246fff17f25073a847","observation_id":"93f6a1e6-2fc9-4009-8b77-8c92d1cbe2b2","resolution":{"observed_at":"2026-08-11T10:20:42.771233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.749246Z","title":"A minimalist approach to offline reinforce- ment learning,","venue":null,"work_id":"d8d9f283-249e-4c7a-b989-fb6652870dd5","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.701076Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:8a5bf7e8bd163aa95a351fa75f89c722e66d98b34fbd9d41413a888e10a3baf6","observation_id":"5cab6046-fd92-4aeb-b32b-ffa60db29e85","resolution":{"observed_at":"2026-08-11T10:20:42.754517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.730280Z","title":"An emphatic approach to the problem of off-policy temporal-difference learning,","venue":null,"work_id":"e8065985-0d3d-499a-b8bf-8adced04c48e","year":2016},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.705949Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:082aaeb25114cff4de7e7b6e71219731dd9068fcd8dce7d91d8e66bbf0fa0415","observation_id":"ed97ed5c-5052-4387-b2c6-4e69babe4d73","resolution":{"observed_at":"2026-08-11T10:20:42.738232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-18T04:12:50.632095Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-11T10:20:41.710374Z","title":"Algaedice: Policy gradient from arbitrary experience,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.710374Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:8604f31dc9f8be7b32bda0ec7f268e9d7bcf858c6c233386a60be8018494d160","observation_id":"5a490ac3-3716-4082-b839-5b668d699a9a","resolution":{"observed_at":"2026-08-11T10:20:41.710374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-11T10:20:41.715755Z","title":"Accelerating on- line reinforcement learning with offline datasets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.715755Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:d0a5aaf019f218e6e3e725b87d83ef687d5bc22e6bd7973a7e4c8c09f34e3a2d","observation_id":"541808ba-a711-488d-90d7-f249620443ae","resolution":{"observed_at":"2026-08-11T10:20:41.715755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-20T03:06:00.034814Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-11T10:20:41.720049Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.720049Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:1c305ddf02073b83c7e9d40cf70de5da762b81bbc0f5f9c01495d2eaeb0eed99","observation_id":"73c47f21-f045-4efe-bf44-27de5bc11b19","resolution":{"observed_at":"2026-08-11T10:20:41.720049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.708043Z","title":"Safe policy improvement with an estimated baseline policy,","venue":null,"work_id":"07308681-268c-4cce-b791-04f7f29b6b70","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.724801Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:ef4703c6836dbabedc00c96153ab1688d29740411b49d9e0bec6c7bd197d2934","observation_id":"47ed3831-d768-40ce-999d-baef74418efb","resolution":{"observed_at":"2026-08-11T10:20:42.717704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.690035Z","title":"An optimistic perspec- tive on offline reinforcement learning,","venue":null,"work_id":"ece86298-bd37-48d4-b7be-abcefbb05641","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.728867Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:1be3eeca3d5923190dfe5d310c0bb96c5be8cab068433a3856e0cb22d0f90735","observation_id":"dad1690d-e67f-4f54-ac3b-b726d033ab6e","resolution":{"observed_at":"2026-08-11T10:20:42.695468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.669353Z","title":"S4rl: Surprisingly simple self- supervision for offline reinforcement learning in robotics,","venue":null,"work_id":"e553e4d6-87eb-456b-81a8-3c846270304d","year":2022},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.734016Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:acb6a7b41689bd30339d92cf5e4b9b34c44bc6063933e0560ec2c7de6e90c6b6","observation_id":"18a22e3b-b762-4a24-bb5e-80cd10656329","resolution":{"observed_at":"2026-08-11T10:20:42.676761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.654093Z","title":"Offline rl without off-policy evaluation,","venue":null,"work_id":"fd453ca5-33c9-4003-a4cd-7ddfdd80163e","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.738135Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:5513d640c15f7e60f00111476f4ce91e5e21ef2a687df1236e0961b3f45cf5d6","observation_id":"d7fa561e-e905-42e9-ab34-4a89264a1b8e","resolution":{"observed_at":"2026-08-11T10:20:42.658956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.639538Z","title":"Offline reinforcement learning as one big sequence modeling problem,","venue":null,"work_id":"86ba4173-329d-462c-9e2a-ab24a0f60a4c","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.742125Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:7865eede19d11271966e2aa2b84b35ac2c6ffa2186685ca0c012dcce659b4510","observation_id":"b35b240d-a462-4756-8444-40ff5f863a1f","resolution":{"observed_at":"2026-08-11T10:20:42.644273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.615850Z","title":"Decision transformer: Reinforcement learning via sequence modeling,","venue":null,"work_id":"6b64a144-89ef-4138-8660-1cd121399014","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.746577Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:bd89429784cfbf73c268714c1cbff72323ef00d5ef01bbfa3e28b92770cbb0ac","observation_id":"54e31358-01ff-4a07-a407-1eab4d30af00","resolution":{"observed_at":"2026-08-11T10:20:42.621688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:41.756293Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.756293Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:77a22f3ab4ca0e78298aae8db18545d322545bead8e6e0c6a97c4d0798ba9263","observation_id":"ae7dcb9e-99ae-42ca-a716-b3a7a983aa05","resolution":{"observed_at":"2026-08-11T10:20:41.756293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.590287Z","title":"Hundreds guide millions: Adaptive offline reinforcement learning with expert guidance,","venue":null,"work_id":"4c5302a7-0c42-4f04-8ef0-22c865ce72be","year":2023},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.760891Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:fb201bdf56e30d8d0b1f5b53bd5c6caf0257d9ff460227bb0ccf37bbcb0ec382","observation_id":"e1df9141-9012-4747-806c-9d0e54530508","resolution":{"observed_at":"2026-08-11T10:20:42.595317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.572284Z","title":"When to trust your model: Model-based policy optimization,","venue":null,"work_id":"aadd1183-611e-4345-94a5-c38bbdb43603","year":2019},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.773035Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:0fe628080d7bff7f69b74f11ef7e966bfa00cca2a7c63ea2efaa911d9f0bc842","observation_id":"0196fc0a-8a7e-4e74-81c2-a4a5369ae92f","resolution":{"observed_at":"2026-08-11T10:20:42.580641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.557583Z","title":"Morel: Model-based offline reinforcement learning,","venue":null,"work_id":"d0ac5d02-62c3-458e-aa1d-d43c1bf9635c","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.777931Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:2a2b799deb4aa2424461f00bc09580338359130b4f357551bc66cc58ff4c5014","observation_id":"3e182e6b-f71e-46a8-bb2c-522e9637557f","resolution":{"observed_at":"2026-08-11T10:20:42.562204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.535976Z","title":"Mopo: Model-based offline policy optimization,","venue":null,"work_id":"70d90a1d-ef32-4dfa-92ce-8c4ccec48799","year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.782731Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:2769d62b53fcaf44541a1ccff6ba44706e9914f86fda9e67a68e395b5d9ed9d2","observation_id":"ac1efbb6-959d-41f9-af68-6f42f61064b5","resolution":{"observed_at":"2026-08-11T10:20:42.541462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.519771Z","title":"Deployment-efficient reinforcement learning via model-based offline optimization,","venue":null,"work_id":"9c195bf6-de12-46e6-9e7e-c2b9e74b2113","year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.786782Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:9e1ae2a7cc4d2a9cd890cd7866e15406504b5d6b11a23ac548d3a04343310205","observation_id":"464d5d27-c0f5-4b6b-a00d-c4f711e32e55","resolution":{"observed_at":"2026-08-11T10:20:42.523716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.503696Z","title":"Agnostic system identification for model- based reinforcement learning,","venue":null,"work_id":"5f016922-b4cc-4d12-9e54-375aa6c968d2","year":2012},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.792834Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:29cc48844ebd970111c8a12abfb035d658bd0af0c470f4ba3dd17ebd750a2f75","observation_id":"c949a1f1-dfe9-442b-b700-b029becd25fd","resolution":{"observed_at":"2026-08-11T10:20:42.511346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.482261Z","title":"Synthesis and stabilization of complex behaviors through online trajectory optimization,","venue":null,"work_id":"fc2b7b2f-e779-4395-b9c6-2019dafd0c28","year":2012},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.799027Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:292da3e4056f0714da4847b5d917c5adffbfb1bd959a00c355043e736fa3a83b","observation_id":"0750ce75-a3e2-4eac-b255-041a0844acd3","resolution":{"observed_at":"2026-08-11T10:20:42.488480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.467853Z","title":"A survey of monte carlo tree search methods,","venue":null,"work_id":"cc2b9216-0b54-4e87-9556-e9785098a3e5","year":2012},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.806496Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:54499e973ad533d09f54128bc00e4fa191fab499786261d3cb66c984fda63524","observation_id":"b83b006e-6a47-4a97-b4b3-88496825af52","resolution":{"observed_at":"2026-08-11T10:20:42.472278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.443515Z","title":"Near-optimal regret bounds for reinforcement learning,","venue":null,"work_id":"9bb3a577-3050-4323-aebe-7cddad015b52","year":2008},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.812481Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:a3a2d44c2fa6e9b02f1e3d37675288f986526fffb3a90706516124c2b0c2ac15","observation_id":"e5e23dc8-9c61-4eca-8f3b-be61c896e3d9","resolution":{"observed_at":"2026-08-11T10:20:42.453522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.421815Z","title":"Deep exploration via bootstrapped dqn,","venue":null,"work_id":"6a232e20-d9c6-4ad4-85f2-45198e751513","year":2016},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.818138Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:b717d93b40f055f0b8a8d9e8c504c1811d2e579f7cde47652538fe9e3ee582a5","observation_id":"bf9156e5-3646-4a9f-ac3c-a83fc7bdcc34","resolution":{"observed_at":"2026-08-11T10:20:42.428736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:41.825283Z","title":"Semi-supervised classification with graph convolutional networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.825283Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:73f7e51737d72fcfd4c9470dd5c84dab5e4d9ecd8f00453a9597a35f4cf39560","observation_id":"a06c13aa-1ede-4dbb-af80-10cfe8f6a11d","resolution":{"observed_at":"2026-08-11T10:20:41.825283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-08-14T20:09:04.632955Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-11T10:20:41.830698Z","title":"Deep learning using rectified linear units (relu),","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.830698Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:513bbc213eacbbeccbbec20297110121e2fc5dcf361e1471fa3e6d50f664de92","observation_id":"b1f40be4-19a9-4df4-9c75-102fda8a9fd9","resolution":{"observed_at":"2026-08-11T10:20:41.830698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:41.836252Z","title":"D4rl: Datasets for deep data-driven reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.836252Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:fdd01a093defbe0a33a2d8b9a40623ca5f40bd97370f72a39675d468a679b9ce","observation_id":"6ef72819-0e7d-4caf-abac-f05f95eab1f9","resolution":{"observed_at":"2026-08-11T10:20:41.836252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.383879Z","title":"Mujoco: A physics engine for model-based control,","venue":null,"work_id":"b0dcb607-1613-4396-aa44-c43fbd433e42","year":2012},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.845581Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:d9915c560fc503d8d6efc95205f4c363bad6366bb9b0c72792bb035720dc7e5b","observation_id":"4cd85f12-5e18-43f0-bc55-655bdc2ce90f","resolution":{"observed_at":"2026-08-11T10:20:42.387727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-11T10:20:41.850772Z","title":"Openai gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.850772Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:6ed3eb4775abe674e54c4b2e0c6e2b900d81aa84e607337699e0ed5cc6bee14c","observation_id":"574e91e4-306d-44de-89a2-4996866dbcf3","resolution":{"observed_at":"2026-08-11T10:20:41.850772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.371261Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations,","venue":null,"work_id":"3c05d908-3358-4009-9f48-2daa339d0233","year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.858111Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:7850a1c07d5728095df3da279100820a810d01eebee9b9511e02b0788ad97b1b","observation_id":"af6916ec-8898-4c75-8cc9-c81d9a8a56ce","resolution":{"observed_at":"2026-08-11T10:20:42.375866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.357271Z","title":"Alvinn: An autonomous land vehicle in a neural network,","venue":null,"work_id":"e9b44261-eaed-4457-9518-4d91f2a65195","year":1988},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.867136Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:09b6ac79486ab1fc2dd06a45a9119c237ce7aad28932aace964101f945ecee44","observation_id":"8c6bc3c8-eed9-4a2a-a55f-fef9217f70e2","resolution":{"observed_at":"2026-08-11T10:20:42.361770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04133","last_updated":"2017-08-10T19:20:15Z","snapshot_observed_at":"2026-08-15T03:09:17.358218Z","submitted_at":"2017-08-10T19:20:15Z","title":"Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.04133","snapshot_observed_at":"2026-08-11T10:20:41.874088Z","title":"Reproducibil- ity of benchmarked deep reinforcement learning tasks for continuous control,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.874088Z"},"links":{"cited_paper":"/paper/1708.04133","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:6a2cec25f37536b7ba0e454f6ae1fcfebc82dacef229a3f70160dabcc2347e2a","observation_id":"53840c34-4bc8-42df-acb7-f53d277e0c31","resolution":{"observed_at":"2026-08-11T10:20:41.874088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10813","last_updated":"2021-09-23T17:34:23Z","snapshot_observed_at":"2026-08-18T21:48:57.136166Z","submitted_at":"2021-09-22T16:03:29Z","title":"A Workflow for Offline Model-Free Robotic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10813","snapshot_observed_at":"2026-08-11T10:20:41.880729Z","title":"A workflow for offline model-free robotic reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.880729Z"},"links":{"cited_paper":"/paper/2109.10813","citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:0a0aaf23c2e942a7a14428b9ff8ed5adf7859554501990ea525273664ca4c377","observation_id":"5e27b303-fd48-4f7a-ab0e-5f3104b3219b","resolution":{"observed_at":"2026-08-11T10:20:41.880729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.337642Z","title":"Relay pol- icy learning: Solving long horizon tasks via imitation and reinforcement learning,","venue":null,"work_id":"e264de3d-1b0a-4a86-90f7-a794af70cc6b","year":2019},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.884813Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:bf64cda317b72ff673bdd62ac5c8ecf8adcf550a5271e9327ef0ce0b508e7d5c","observation_id":"548014ce-ca7f-43a7-892d-8c1afd42e30c","resolution":{"observed_at":"2026-08-11T10:20:42.344721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:41.891069Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.891069Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:5ebe4fc750d2f2688f7b219ec1b9efe68edb483b2f41fc35e70ea6f2200660d2","observation_id":"2ae1ff18-92e9-4440-b0d7-55972b6bcb1e","resolution":{"observed_at":"2026-08-11T10:20:41.891069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.308566Z","title":"Stability analysis of discrete-time infinite-horizon optimal control with discounted cost,","venue":null,"work_id":"53a9d7d5-3550-4840-aa90-3fd72c057ad3","year":2016},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.895075Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:dd44390d4d6d3d871302d326198f74a148891a3db932d6cc7a026a6964bd5d44","observation_id":"160307f8-775d-4ca5-8bd4-3c94906f7760","resolution":{"observed_at":"2026-08-11T10:20:42.313359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:20:42.287863Z","title":">\" to \" <","venue":null,"work_id":"b454cc6a-c589-4540-93d3-018695b3d1f6","year":null},"citing_paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:41.901207Z"},"links":{"citing_paper":"/paper/2412.16848"},"observation_digest":"sha256:34b7b63f412e4b981de5efaf7228cda38451a0a10de4a10f0ac34b0caba89e2d","observation_id":"3af05d7b-1290-4ff3-a114-3b8248558388","resolution":{"observed_at":"2026-08-11T10:20:42.293002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.16848","last_updated":"2025-03-17T06:25:26Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T23:15:41.030165Z","submitted_at":"2024-12-22T04:18:02Z","title":"ACL-QL: Adaptive Conservative Level in Q-Learning for Offline Reinforcement Learning"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":60},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2412.16848."}