{"as_of":"2026-08-19T01:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:05d9a7181185063ccf2e2a998cfb52981e5c8d1af18b826e05b4aecbe691c25d","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:14:54.453290Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18766/citation-record","integrity":"/paper/2504.18766/integrity","json":"/paper/2504.18766/citation-record.json","paper":"/paper/2504.18766"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.261524Z","title":"Behavior priors for efficient reinforcement learning","venue":null,"work_id":"1981e352-a60e-4bad-b9f9-8d0da25249e1","year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.270338Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:1615ca4502d2b7ee8c6ed0e171edc3ac95e29272521856c6c87988359287f66c","observation_id":"f4617197-167f-4087-a297-6580c6f3e361","resolution":{"observed_at":"2026-08-16T10:14:55.266723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.276294Z","title":"Deep q-learning from demonstrations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.276294Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:b914042025077c33a5cc5cbe6aca81388f8056ea342a16256b38b4d7d9adae2a","observation_id":"34cd9837-379f-4b9c-89f0-61985a43107d","resolution":{"observed_at":"2026-08-16T10:14:54.276294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.238734Z","title":"Policy optimization with demonstrations","venue":null,"work_id":"9bf1c2f2-768c-4ad1-addd-67bc5c3e7d56","year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.281680Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:02778c0926b3ea64104500d32fedc0507acf2b6ccbee70e0cd4267824c8e3e51","observation_id":"5b6da731-1ffe-47b6-9e27-5b82021330b9","resolution":{"observed_at":"2026-08-16T10:14:55.242951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10089","last_updated":"2018-02-25T07:48:19Z","snapshot_observed_at":"2026-08-14T20:28:40.030071Z","submitted_at":"2017-09-28T17:51:48Z","title":"Overcoming Exploration in Reinforcement Learning with Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10089","snapshot_observed_at":"2026-08-16T10:14:54.287163Z","title":"Overcoming exploration in reinforcement learning with demonstrations, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.287163Z"},"links":{"cited_paper":"/paper/1709.10089","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:a0b825d39cbc6c319f9dc1b9883903d0359f7976ee70ce22203cf6bae8b828cb","observation_id":"4ef7c341-1120-4948-ac00-da056b930675","resolution":{"observed_at":"2026-08-16T10:14:54.287163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01387","last_updated":"2019-09-03T18:20:48Z","snapshot_observed_at":"2026-08-18T07:28:44.515670Z","submitted_at":"2019-09-03T18:20:48Z","title":"Making Efficient Use of Demonstrations to Solve Hard Exploration Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01387","snapshot_observed_at":"2026-08-16T10:14:54.293113Z","title":"Making efficient use of demonstrations to solve hard exploration problems","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.293113Z"},"links":{"cited_paper":"/paper/1909.01387","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:b7fcd0a43a2beb6c05ed526a801ef17dbe020a71c7249eb48ba3f9401da3fd23","observation_id":"36574b8c-082d-43e2-8c70-50bfa9d31dff","resolution":{"observed_at":"2026-08-16T10:14:54.293113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.298605Z","title":"Shaping rewards for reinforcement learn- ing with imperfect demonstrations using generative models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.298605Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:15e9f1f4e828d1e0cb8fba10b12f9a4c6375a7c15a3e99fa3ba095e392c010cd","observation_id":"40fa7fe9-2f8d-41fe-bcb6-ab4b0843947a","resolution":{"observed_at":"2026-08-16T10:14:54.298605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-16T10:14:54.303847Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.303847Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:a13f4640bcd664213b4dece0d392570b7fe69564b85ff6a5733f62e23d128d2c","observation_id":"863b70f7-1509-4a93-a694-073bc01ba358","resolution":{"observed_at":"2026-08-16T10:14:54.303847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.224905Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":"89afc718-7141-4a4e-a289-76398ba7c89e","year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.308476Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:47a8bc1f1b84ab5feba57016655a101e7b14b65435ea3349822ad0b18b3850b8","observation_id":"6905ef46-0e3e-47ce-ba22-409ba4d27985","resolution":{"observed_at":"2026-08-16T10:14:55.229083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.03201","last_updated":"2018-12-18T23:40:20Z","snapshot_observed_at":"2026-08-18T21:50:42.167249Z","submitted_at":"2018-12-07T20:10:23Z","title":"Residual Reinforcement Learning for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.03201","snapshot_observed_at":"2026-08-16T10:14:54.312313Z","title":"Residual reinforcement learning for robot control, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.312313Z"},"links":{"cited_paper":"/paper/1812.03201","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:a46c1212468a84d2d49e6257dfe2fdd00e03435fbdfe7be9ccfaa3bcaedd8fdf","observation_id":"7119433e-63c7-4298-b95b-6aefad78ae80","resolution":{"observed_at":"2026-08-16T10:14:54.312313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01737","last_updated":"2025-08-11T01:00:11Z","snapshot_observed_at":"2026-08-16T14:55:38.606027Z","submitted_at":"2023-10-03T01:55:54Z","title":"Blending Imitation and Reinforcement Learning for Robust Policy Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01737","snapshot_observed_at":"2026-08-16T10:14:54.316566Z","title":"Stevens, Matthew R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.316566Z"},"links":{"cited_paper":"/paper/2310.01737","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:434d36ebb77b6f28b6d43b6f167848545beb8a752d3776e5ec3a51507db8b8b5","observation_id":"da529b81-927c-4923-bf64-33a7f839ca3f","resolution":{"observed_at":"2026-08-16T10:14:54.316566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13846","last_updated":"2022-10-25T09:08:26Z","snapshot_observed_at":"2026-08-18T07:29:36.505370Z","submitted_at":"2022-10-25T09:08:26Z","title":"Adaptive Behavior Cloning Regularization for Stable Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13846","snapshot_observed_at":"2026-08-16T10:14:54.320971Z","title":"Adaptive behav- ior cloning regularization for stable offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.320971Z"},"links":{"cited_paper":"/paper/2210.13846","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:fc911b1ca8149b9775ff7eb18a9e094c12920101db0effe4464e954d2e99ac9b","observation_id":"aafdd562-9db4-4a11-9b1f-a998429c3d3d","resolution":{"observed_at":"2026-08-16T10:14:54.320971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-08-15T17:49:11.636243Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-16T10:14:54.325230Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.325230Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:779bf0b6bb92a9f9005aabe02ff8ea31b39531d515d4b8e4d821128fef04b66c","observation_id":"6fd32781-7de5-41c1-8e7a-a9218de8a13b","resolution":{"observed_at":"2026-08-16T10:14:54.325230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-14T20:44:55.096659Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-16T10:14:54.329302Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.329302Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:93b08ae423c8d8b1bce472fe584fef04c29c16f890c2ce9a12e636d9cb95c1db","observation_id":"67b536a4-7de8-4665-a745-256f207762e4","resolution":{"observed_at":"2026-08-16T10:14:54.329302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00591","last_updated":"2021-10-30T04:21:12Z","snapshot_observed_at":"2026-08-18T07:30:05.382768Z","submitted_at":"2021-07-01T16:26:54Z","title":"Offline-to-Online Reinforcement Learning via Balanced Replay and Pessimistic Q-Ensemble","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00591","snapshot_observed_at":"2026-08-16T10:14:54.333775Z","title":"Offline-to- online reinforcement learning via balanced replay and pessimistic q-ensemble, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.333775Z"},"links":{"cited_paper":"/paper/2107.00591","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:67a311f786cc61c3e1fbc7129de62fd9684c18b993b65473183c41bd9dfd9791","observation_id":"6025f4a1-3a8e-473c-82c0-c882325869c0","resolution":{"observed_at":"2026-08-16T10:14:54.333775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11802","last_updated":"2022-11-21T19:10:27Z","snapshot_observed_at":"2026-08-16T16:14:24.609732Z","submitted_at":"2022-11-21T19:10:27Z","title":"Improving TD3-BC: Relaxed Policy Constraint for Offline Learning and Stable Online Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11802","snapshot_observed_at":"2026-08-16T10:14:54.338344Z","title":"Improving td3-bc: Relaxed policy constraint for offline learning and stable online fine-tuning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.338344Z"},"links":{"cited_paper":"/paper/2211.11802","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:d45a6a2af3096bd93418f401aa0b39f954ce719ed4ab3dc8abf4e61df3f3c95f","observation_id":"53c99f43-2e76-4a79-b6f1-d858f2e8c086","resolution":{"observed_at":"2026-08-16T10:14:54.338344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.343326Z","title":"Online decision transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.343326Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:60313d56d9d87f2f50c60307748be5a80279bf683ffeb3c07666df4da75a296e","observation_id":"5e332916-4a8d-44bd-94fd-303d6541c71e","resolution":{"observed_at":"2026-08-16T10:14:54.343326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14500","last_updated":"2020-10-27T17:57:29Z","snapshot_observed_at":"2026-08-16T19:10:10.051564Z","submitted_at":"2020-10-27T17:57:29Z","title":"COG: Connecting New Skills to Past Experience with Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14500","snapshot_observed_at":"2026-08-16T10:14:54.347894Z","title":"Cog: Connecting new skills to past experience with offline reinforcement learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.347894Z"},"links":{"cited_paper":"/paper/2010.14500","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:f7b9eebaa5e904d1ba78d5252a520cc6397006dcd1c92fa8c0e5e572009b353c","observation_id":"b8297af3-273c-4e96-a3a0-ff321d74c71b","resolution":{"observed_at":"2026-08-16T10:14:54.347894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09816","last_updated":"2023-01-24T05:01:23Z","snapshot_observed_at":"2026-08-18T07:30:08.413712Z","submitted_at":"2023-01-24T05:01:23Z","title":"SMART: Self-supervised Multi-task pretrAining with contRol Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09816","snapshot_observed_at":"2026-08-16T10:14:54.352681Z","title":"Smart: Self-supervised multi-task pretraining with control transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.352681Z"},"links":{"cited_paper":"/paper/2301.09816","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:6f491ca750e303ca356bb08c2a06cafab4bec7b0b3330d508f37f9376585c916","observation_id":"8e0c9724-8e88-4e2c-9768-67d9b35ed723","resolution":{"observed_at":"2026-08-16T10:14:54.352681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-16T16:24:37.265288Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-16T10:14:54.357538Z","title":"Andrew Bagnell, Akshay Krishnamurthy, and Wen Sun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.357538Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:c7362a83778a70ccaf2daf1baaab699575a9eca590743c187e30bdd4e1a7a7fb","observation_id":"3bb942ba-3794-4427-87e2-f55fcd3e96c4","resolution":{"observed_at":"2026-08-16T10:14:54.357538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08050","last_updated":"2021-06-15T11:16:49Z","snapshot_observed_at":"2026-08-18T07:29:35.450163Z","submitted_at":"2021-06-15T11:16:49Z","title":"Residual Reinforcement Learning from Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08050","snapshot_observed_at":"2026-08-16T10:14:54.361758Z","title":"Residual reinforcement learning from demonstrations, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.361758Z"},"links":{"cited_paper":"/paper/2106.08050","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:ffac58d60ddf691e71a9e38c2198d7cac81a996463facee31524883ffe03c57f","observation_id":"3c10010b-509a-4753-8cf0-9a5a861f0bad","resolution":{"observed_at":"2026-08-16T10:14:54.361758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.365995Z","title":"Residual learning from demonstration: Adapting dmps for contact- rich manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.365995Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:a97f1c8cf4afb40ad4c9c6749a9ac4574505293a206ab18431a756c58840f058","observation_id":"68f16692-46d8-4506-88cc-bd8c834709aa","resolution":{"observed_at":"2026-08-16T10:14:54.365995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02073","last_updated":"2023-03-03T16:44:33Z","snapshot_observed_at":"2026-08-18T07:29:40.695463Z","submitted_at":"2023-03-03T16:44:33Z","title":"How To Guide Your Learner: Imitation Learning with Active Adaptive Expert Involvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02073","snapshot_observed_at":"2026-08-16T10:14:54.369813Z","title":"How to guide your learner: Imitation learning with active adaptive expert involvement, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.369813Z"},"links":{"cited_paper":"/paper/2303.02073","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:73f2f12c72068ed81dc8a661a09006eb9bade3ceea70a90e90f1f64ff895fbe2","observation_id":"223a9ce2-b5a4-4816-8446-28cee70bb27f","resolution":{"observed_at":"2026-08-16T10:14:54.369813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09446","last_updated":"2022-09-20T03:46:04Z","snapshot_observed_at":"2026-08-18T07:29:09.378885Z","submitted_at":"2022-09-20T03:46:04Z","title":"A Joint Imitation-Reinforcement Learning Framework for Reduced Baseline Regret","version":1},"cited_work":{"arxiv_id":"2209.09446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.09446","snapshot_observed_at":"2026-08-16T10:14:54.631357Z","title":"A Joint Imitation-Reinforcement Learning Framework for Reduced Baseline Regret","venue":"cs.LG","work_id":"d88aa878-c159-4c9a-be1f-1dc0e21cae05","year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.374521Z"},"links":{"cited_paper":"/paper/2209.09446","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:608a2fc0d7b6e3f7b472efcde16ec6ba3a0a14fed0435dbc0d056a496a473b6a","observation_id":"908a6351-5a98-46d4-8104-5e1650dbb90e","resolution":{"observed_at":"2026-08-16T10:14:54.636203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01780","last_updated":"2018-06-05T16:21:25Z","snapshot_observed_at":"2026-08-16T01:36:11.279248Z","submitted_at":"2018-06-05T16:21:25Z","title":"Mix&Match - Agent Curricula for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01780","snapshot_observed_at":"2026-08-16T10:14:54.379501Z","title":"Jayakumar, Max Jaderberg, Leonard Hasenclever, Yee Whye Teh, Simon Osindero, Nicolas Heess, and Razvan Pascanu","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.379501Z"},"links":{"cited_paper":"/paper/1806.01780","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:82aafb175b5150a4062ec2e9df36cf3df9bfb7de103332091808a60bf279f753","observation_id":"6daf6545-cc68-4948-8d54-388426735fff","resolution":{"observed_at":"2026-08-16T10:14:54.379501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.201647Z","title":"Curriculum offline imitating learning","venue":null,"work_id":"f7e9922c-13ee-4b26-bef2-c5c837870756","year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.384253Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:e9e5a034edcef300e3261abf211eb388364090ca2bdccb7e6632659920dd9634","observation_id":"9e30ddfa-ad8f-4ac9-afc2-59595473dcbe","resolution":{"observed_at":"2026-08-16T10:14:55.206324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.186892Z","title":"Efficient reductions for imitation learning","venue":null,"work_id":"168f013b-48fd-475d-993d-436c7807b229","year":2010},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.388596Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:eedf439bee111d57f9b5a0f8765f831903b2b826f99014a6585cc9c17e5f007c","observation_id":"803151ae-a3d8-48ea-9ce0-f5ae9698cb6e","resolution":{"observed_at":"2026-08-16T10:14:55.191561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.171529Z","title":"Andrew Bagnell, and Byron Boots","venue":null,"work_id":"197057c4-9a50-4968-a633-28ddbd659860","year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.393261Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:7bfdad5c49cf71cd5566d6fb45001d09e1e081980985542d0540846b3428d66f","observation_id":"f51beeca-4455-420f-bf38-cc652693a954","resolution":{"observed_at":"2026-08-16T10:14:55.176684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15397","last_updated":"2023-01-14T21:15:15Z","snapshot_observed_at":"2026-08-18T07:29:49.741300Z","submitted_at":"2022-05-30T19:29:56Z","title":"Minimax Optimal Online Imitation Learning via Replay Estimation","version":5},"cited_work":{"arxiv_id":"2205.15397","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.15397","snapshot_observed_at":"2026-08-16T10:14:54.593621Z","title":"Minimax Optimal Online Imitation Learning via Replay Estimation","venue":"cs.LG","work_id":"4a331edf-ac17-43d0-85c4-d369310c17db","year":2022},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.397739Z"},"links":{"cited_paper":"/paper/2205.15397","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:8b2f4cac8bd016ed567b0c12d461aaa5253bc8c5f370b122238af761522d4532","observation_id":"511b9796-2809-4fce-ad72-ab38789993b7","resolution":{"observed_at":"2026-08-16T10:14:54.599638Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08848","last_updated":"2024-06-05T00:17:20Z","snapshot_observed_at":"2026-08-16T14:18:48.596694Z","submitted_at":"2024-02-13T23:29:09Z","title":"Hybrid Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08848","snapshot_observed_at":"2026-08-16T10:14:54.402435Z","title":"Andrew Bagnell, and Sanjiban Choudhury","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.402435Z"},"links":{"cited_paper":"/paper/2402.08848","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:477ee78b2ee76a7fb6bf21093de53f94992a504496dd99742daac723a5f83093","observation_id":"d6510b98-d9d2-47d7-86e3-6da80d8cf57e","resolution":{"observed_at":"2026-08-16T10:14:54.402435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.156727Z","title":"Deep reinforcement learning that matters","venue":null,"work_id":"c60c891e-886d-4475-b611-3011f62023b6","year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.406486Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:6ddbbdcecb750e3ec5bbf0562b2ab441f9d9e537940c912ea18fc81f221ac3cc","observation_id":"72738d34-8191-4add-8172-64b87ca13f58","resolution":{"observed_at":"2026-08-16T10:14:55.161626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10031","last_updated":"2018-11-19T18:57:02Z","snapshot_observed_at":"2026-08-18T07:30:07.444149Z","submitted_at":"2018-02-27T17:16:48Z","title":"The Mirage of Action-Dependent Baselines in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.10031","snapshot_observed_at":"2026-08-16T10:14:54.410262Z","title":"Turner, Zoubin Ghahramani, and Sergey Levine","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.410262Z"},"links":{"cited_paper":"/paper/1802.10031","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:488134e9369155de46f38dcdb407ee1bea010041aee6b306ee66e3155a508389","observation_id":"55e0e295-bb48-4232-9e43-45519dd61148","resolution":{"observed_at":"2026-08-16T10:14:54.410262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12729","last_updated":"2020-05-25T16:24:59Z","snapshot_observed_at":"2026-08-17T14:39:44.168275Z","submitted_at":"2020-05-25T16:24:59Z","title":"Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12729","snapshot_observed_at":"2026-08-16T10:14:54.414297Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.414297Z"},"links":{"cited_paper":"/paper/2005.12729","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:4bf3105b9cad35521f1b4b2306f5533b862f095460fcd95f9dbf24703985b577","observation_id":"76df687c-b747-47bb-a911-6ea3f7a8c79d","resolution":{"observed_at":"2026-08-16T10:14:54.414297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-08-14T07:14:28.634639Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-16T10:14:54.418091Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.418091Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:3317ad1da51f71f3f0db6c98e4b672f1c89452eac1c8429d6454da1ce8c90828","observation_id":"1a0f3ae6-d2d7-4194-9f6d-698e1499cec5","resolution":{"observed_at":"2026-08-16T10:14:54.418091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-16T10:14:54.422093Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.422093Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:cd286138ac3fe78ba8e6ff3ea8c9ef4c0e4dd753c78f894462675b6547d2c1f4","observation_id":"313d14f8-bc2a-48f7-81d4-a4a9c375226a","resolution":{"observed_at":"2026-08-16T10:14:54.422093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.427068Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.427068Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:7e0878b4f2b7c1a8f638f79c569b1334b0537142dd48bda2065989317c2035cd","observation_id":"2068defa-6aff-4fa9-8d44-9889a73797d1","resolution":{"observed_at":"2026-08-16T10:14:54.427068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-16T10:14:54.431342Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.431342Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:e04ebaf03fe0f51f1da79c06009dba34c2af063b30b781e9170c7c09f2ebcf4e","observation_id":"35372177-d14e-4d48-9819-247143aa85b5","resolution":{"observed_at":"2026-08-16T10:14:54.431342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:54.435874Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.435874Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:c810cef3c907bbf5fbbad11953ed5ac8496282b4d64c1257aeb9e5c0e5f00ace","observation_id":"b539be7f-340c-4618-b4d3-da8997ab1df9","resolution":{"observed_at":"2026-08-16T10:14:54.435874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.123990Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"a41cf73b-c339-4a97-9604-61af10294e3c","year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.440225Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:86a6c7271129113dc86f16c317b121fc78b439a0a2ae9b52167d6059d68cbb17","observation_id":"ed82b5ed-059e-480a-8e01-42ea275b414c","resolution":{"observed_at":"2026-08-16T10:14:55.128328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.110622Z","title":"A framework for behavioural cloning","venue":null,"work_id":"97b766a9-4929-4cb1-91cc-be0a07309555","year":1995},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.444432Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:c170a143b4508f0874ffa51ee119b7faf7fea63022cdf4b5a74d9535793e8ed0","observation_id":"d3925d08-ee9d-48e7-a5cf-c9b2d67e674e","resolution":{"observed_at":"2026-08-16T10:14:55.114686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-16T10:14:54.453290Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.453290Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:7a663d8b1024f575b69c9b39e154965cb8c36e4d53c1dba226895f92c3483d74","observation_id":"32ae6160-3b58-4e9c-a8cb-73b250fc5e73","resolution":{"observed_at":"2026-08-16T10:14:54.453290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:14:55.097151Z","title":"ISBN 0198538677","venue":null,"work_id":"471f5aee-8074-4797-a0b9-a3b1161d06f8","year":null},"citing_paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-16T10:14:54.448900Z"},"links":{"citing_paper":"/paper/2504.18766"},"observation_digest":"sha256:a3b9771062afe70fd2e1701b71f301039f56ce3770d44e68a489015b060064a4","observation_id":"ecf8ff24-7d47-4cba-8096-cf371fa7992f","resolution":{"observed_at":"2026-08-16T10:14:55.101298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18766","last_updated":"2025-04-26T02:12:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T17:02:17.469433Z","submitted_at":"2025-04-26T02:12:02Z","title":"Dynamic Action Interpolation: A Universal Approach for Accelerating Reinforcement Learning with Expert Guidance"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2504.18766."}