{"as_of":"2026-08-20T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1df4a3f170efa964ec1e8fbb2299abe6019202e9c420cde5abf7aa94954fb1e","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T05:24:53.844059Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.26527/citation-record","integrity":"/paper/2606.26527/integrity","json":"/paper/2606.26527/citation-record.json","paper":"/paper/2606.26527"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Deep reinforcement learning for autonomous driving: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:3bc1134c6448ea795bae0add2561939c004378d09c441caa7213764e6f04f37a","observation_id":"cf04b379-a558-485b-9187-494c8668fe6d","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Safe reinforcement learning for autonomous lane changing using set-based prediction,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:15407966fa032365db191cffec81a4d45b6f5118f27309fb27072b40c6976770","observation_id":"a2e17af3-df6a-4c55-a763-0e71219471f5","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Unsupervised reinforcement learning for multi-task autonomous driving: Expanding skills and cultivating curiosity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:62428698d75774dd5d9b1d7e6ac4fcd2ae2efb9476c14c18240b3beed6a35947","observation_id":"fce97bd5-f466-400d-af0c-9d9953b00104","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Driving tasks transfer using deep reinforcement learning for decision-making of autonomous vehicles in unsignalized intersection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:068e480041ff61afd4b77b5ba0df679b5cdbcd184688f18c6c9a4d05e42c04a2","observation_id":"5c14c1ad-31b6-4e3d-92ee-058642c07588","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"A perspective of q-value estimation on offline-to-online reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:05231a6af0c9df519977f4f87ab6f32f2cdf0a6b5aef033dd890595553818571","observation_id":"e3d9fff5-edaa-4ff9-9209-7d806b0a3493","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Sim-to-lab-to-real: Safe reinforcement learning with shielding and generalization guarantees,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:5175428932594a49409f254901dc35fa721ce629d550ce765a7bbfd83f02f92e","observation_id":"c4d5d787-db8f-43ce-b0e2-7e1a84d496e7","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Knowledge transfer from simple to complex: A safe and efficient reinforcement learning framework for autonomous driving decision-making,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:b9e7f007317e0c9dd6517d4f34a687ddae37893914d98130f0572a3453eadcf4","observation_id":"591fc16c-fcbc-446b-93fd-438e2e3138f4","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Zero-shot deep reinforcement learning driving policy transfer for autonomous vehicles based on robust control,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:f03d82fd2566df66dd2787da788f02d1ec0297b3dd2ee6e7899a1a850db0744b","observation_id":"b59c97a9-9156-47a6-a5bd-e86894a34787","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Safety reinforcement learning control via transfer learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:c46223338dcc6d5e0f6547cfb078721d8deba7990f71f2fcc51cd4315b65d3fc","observation_id":"51924c67-6b7c-436b-b71b-447134fbb78f","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.06001","last_updated":"2019-10-14T09:15:31Z","snapshot_observed_at":"2026-08-04T00:14:31.422676Z","submitted_at":"2019-10-14T09:15:31Z","title":"Federated Transfer Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"1910.06001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.06001","snapshot_observed_at":"2026-07-04T13:09:51.459565Z","title":"Federated trans- fer reinforcement learning for autonomous driving,","venue":null,"work_id":"e872a660-f8a5-45f5-8a91-62b613080643","year":1910},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"cited_paper":"/paper/1910.06001","citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:1c7b2aae755cd3c1eae98bc3955f87b781aaf55e5a4311ea619fe8e4b7638853","observation_id":"2b113a94-afcf-4c4a-9f7a-6b229e3bceb3","resolution":{"observed_at":"2026-07-04T13:09:51.461041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Scenario- level knowledge transfer for motion planning of autonomous driving via successor representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:1b61c9ba5b53e055db64a0097821f99fc77fb7795a6cd5b2efa40500d7987397","observation_id":"d6a73046-0631-4f66-b92c-e81d32f3f35a","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Self-supervised domain transfer for reinforcement learning-based autonomous driving agent,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:f06ef1f7c5f0e972921714adbb8f0ef989c6dfea2eb26b9f62ff77138d0e0c66","observation_id":"9c83d9e7-d7dd-4c78-b75e-f76744b697c4","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Cross-domain adaptive transfer reinforcement learning based on state-action correspondence,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:357386560ce4730995023b549e72200c73a13bf3d66b55802c61ddf3e845a237","observation_id":"ece1c202-224d-45b4-8661-ddc911f8f7ef","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-14T20:44:55.096659Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":"1707.08817","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-07-10T21:47:36.312721Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","venue":"cs.AI","work_id":"a4478529-fa6c-4c19-98bd-743c55919fd6","year":2017},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:29f7fc9fd5834abc9e56d0ba07c323bb72b30c0b7bc79dc9813123f3c95929e9","observation_id":"c6cc2845-4143-4127-9651-c2d2b5564dfc","resolution":{"observed_at":"2026-07-04T13:09:51.465730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Policy optimization with demonstrations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:95b19b01d2c8de91dabbd89d851fcd4ed58ed7c0278e78eb60f618c26fede654","observation_id":"51573923-6671-471a-8f60-903a588abe1a","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06342","last_updated":"2016-02-22T19:59:40Z","snapshot_observed_at":"2026-08-14T22:22:09.818117Z","submitted_at":"2015-11-19T20:17:27Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"1511.06342","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.06342","snapshot_observed_at":"2026-07-04T13:09:51.462075Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","venue":"cs.LG","work_id":"789477c9-f258-4167-8cd4-46bbb504929d","year":2015},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"cited_paper":"/paper/1511.06342","citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:f61059191db2356b5f36e00ae209f661184702d97ffabc817c809681a633c66a","observation_id":"7506a50e-5af8-4a9c-b942-0fa355e5c99c","resolution":{"observed_at":"2026-07-04T13:09:51.463357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Knowledge transfer for deep reinforcement learning with hierarchical experience replay,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:7c5f57be792054a694b5d7c9f2b6e9dabd7e90dbb9f6fd6d9d2c0444f73a6298","observation_id":"5a818391-6a13-46d5-baae-a766260f1c2a","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Improving reinforcement learning with confidence-based demonstrations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:544391b4f3cfed6f0bcec2fc12d56e4028ba5b82e4393181df3a05fc536c8677","observation_id":"dd322c82-940b-4847-9f50-009e2b09887b","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"An enhanced advising model in teacher-student framework using state categorization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:0335daa5fe5bb56d6c56765469e0614593c5d641bf174319402ab31bbf1d62ba","observation_id":"ac78be33-341c-4ed4-9482-7bc04e89ead8","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Human as ai mentor: En- hanced human-in-the-loop reinforcement learning for safe and efficient autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:92df1e6059b177c688bb4b0c0edef4aa37688315f4b5976e1a7dac966b886e54","observation_id":"35443eb2-b724-492f-a2a7-c1e5e229d202","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Adaptive action advising with different rewards,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:5cea077881ac369744e480bc878fec78c9dbc498e4a120444c9f2ba68da5d68f","observation_id":"5ff7d50e-9183-4796-a818-4f3a7854372d","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Safe reinforcement learning via shielding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:d2350a35ac0cc0c74b4917bba44cbfcb20d9c048537dfe7de40889119b1129aa","observation_id":"44423618-ab82-467b-9f54-4ef25c0745a1","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Safe reinforcement learning via shielding under partial observability,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:6f02c807fd2c65056b05c56499965e4780a592c3bb408f01b6987f0db7f2b063","observation_id":"9cbaf01e-e927-48f0-89f0-76929bceba3f","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Robust model predictive shielding for safe reinforcement learning with stochastic dynamics,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:73f4acc05853c63b82d962c834649790bc7786552ce88210fcc645bc912ba38a","observation_id":"2a9008c0-cc72-42e4-b01f-dee595077db0","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Teaching on a budget in multi-agent deep reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:9b70eacc645ec170996208a6b863dd367dea7d42a6b1439f01200dc9acbe853c","observation_id":"091bdc8c-596e-4a05-96d4-1c8a5475428f","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Action advising with advice imitation in deep reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:02f8505ad23422a3902204e5b1dd02b743ea35eb47a0f14326a00f66c2437122","observation_id":"09cf7116-3b99-46f5-b7f7-4c955abcde58","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Reinforcement learning with demonstrations from mismatched task under sparse reward,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:d7189ba707724695d8da0d471e8def13847e448072f51202a7dd8629ddc05898","observation_id":"1819784a-bfcb-4a02-a127-2312f6c6190f","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Psiphi- learning: Reinforcement learning with demonstrations using successor features and inverse temporal difference learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:4ba60a858539989c5bac43ba3a4acb22b1898f2b80d4787c6cd5a121e82fb011","observation_id":"a5e4480f-bf24-4c73-bc58-408d5628c2b3","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Hybrid reinforcement learning with expert state sequences,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:e8d5887b34c2c03552e8a66303c1d77ba89043f386f30492d263d602b1317940","observation_id":"ab690933-2014-4bb6-b2bb-e2e0fb4f15eb","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Guided exploration with proximal policy optimization using a single demonstration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:3175fdb158f8c7c5b9702c124d6d3247c6db74ad7759f4e0b62c718a68371d9a","observation_id":"a1854cbe-9c52-4d5b-85a8-f8940ea56f1c","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Hybrid rl: Using both offline and online data can make rl efficient,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:a62577fd9bdb85973b5afbb74f1f319d421f5a4e48e452e052f56cdeeac4c57c","observation_id":"251ee9eb-b1ee-4b4c-877d-25ae7f1b78be","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:be31a4749f9a84ebf3dd6d1993ec3f230efde8f5f830de290455aa018989feb0","observation_id":"4041bed7-64c6-4b9e-82db-c2f9f345862b","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07380","last_updated":"2021-09-15T15:39:46Z","snapshot_observed_at":"2026-08-16T17:56:23.336374Z","submitted_at":"2021-09-15T15:39:46Z","title":"DCUR: Data Curriculum for Teaching via Samples with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2109.07380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.07380","snapshot_observed_at":"2026-07-04T13:09:51.466813Z","title":"Dcur: Data curriculum for teaching via samples with reinforcement learning,","venue":null,"work_id":"7e7666a5-e361-4e7e-b9b7-0e645be0a8d1","year":2021},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"cited_paper":"/paper/2109.07380","citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:30f1a4b1081b14db057ef7a0697839363c1f26b0f6d3e122774635e5f9ad13b0","observation_id":"4f2ca2ef-c774-4ebf-a232-e93879ef4e7f","resolution":{"observed_at":"2026-07-04T13:09:51.468188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"An actor-critic algorithm for constrained markov decision processes,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:1bbab12b5c9add0d38c1eb2e9601753e35da4e0fa61e5d062a8368d0438b299c","observation_id":"5ab869bf-1fba-4c0a-9ffc-792e8f05443d","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Reinforcement learning by guided safe exploration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:21f3055c94743e8c5f1b575fac5825a6d2eaffe360b81ae50c73e6c161dbf19a","observation_id":"0578096c-f9a8-494a-928a-7a189c9dbeef","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Guarded policy optimization with imperfect online demonstrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:a25a3d6b5076891f53f61d4226434055938df2ab1cfee168e961ea711a6c5dcc","observation_id":"c2a8f051-75fd-4428-b5b5-5fb506f68ea7","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Approximately optimal approximate rein- forcement learning,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:98e0053c7efc6cd9ef9b4a5f273ea9e1b5b32181d7302484846b92b9a891fcdc","observation_id":"2d22defa-47d6-4af8-a64f-17b48a3c876b","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:b2b595ee787052ba0cd573337ff63043e3b6ef91212ef9591871557d7caa106c","observation_id":"b87f193d-c0a9-4091-a0bc-7c65dd6697f1","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:7c123469a6a206a7fd48e47cb02131fd3ff2632e899fff644d0b9e8896fe88f3","observation_id":"3c18163e-bda3-44bd-9f4c-8dd0fd2778b3","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"An environment for autonomous driving decision-making,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:0d8d432f208449070147a94bf9ad83c19e679144978c9fe1cc1072d187ee7098","observation_id":"ed8ab7f1-2817-4cbc-bfed-d933c3328404","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"The kinematic bicycle model: A consistent model for planning feasible trajectories for autonomous vehicles?","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:71e443a73a8d1d34f25f4ae5d785abca4b1734443d2c0918aadd7ee890a19025","observation_id":"68a96287-ca84-4736-9699-37832c968bf5","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Congested traffic states in empirical observations and microscopic simulations,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:65c6b51146ea3fbc58148852764a51a66b67fe9d5e65c53d470bbb227c77ca31","observation_id":"370964a7-e7ae-4569-ad97-1df63392fd99","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Preferred time-headway of highway drivers,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:15cc0c3647f18607bc065d3ccc4c5f0e8eeae4787362d9fc7c8c45bd135a9b99","observation_id":"15dea300-1ea8-436c-b2aa-4a247d2c1036","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:834ef59bed92f3829fc94f71ed5f43afd8ddf34431258665bea05d0e35747591","observation_id":"84badfd9-f38a-4ea2-a1dd-947c2fb79cbd","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:24:53.844059Z","title":"Responsive safety in reinforce- ment learning by pid lagrangian methods,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T05:24:53.844059Z"},"links":{"citing_paper":"/paper/2606.26527"},"observation_digest":"sha256:5002aa85170329551a3d9e4adf29f71861a199ac8556241ab763fd702a7e0fec","observation_id":"0b27eee5-acbd-4cdb-a2e9-8d64c5f405d3","resolution":{"observed_at":"2026-06-26T05:24:53.844059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.26527","last_updated":"2026-06-25T02:02:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T22:12:15.482334Z","submitted_at":"2026-06-25T02:02:37Z","title":"Sample-efficient Transfer Reinforcement Learning via Adaptive Reward Shaping and Policy-Ratio Reweighting Strategy"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2606.26527."}