{"as_of":"2026-08-08T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ecf200373c75fab1c2353dc441d948006032c2aef699539bf63f0f69d382ced","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T05:00:24.832807Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.27180/citation-record","integrity":"/paper/2606.27180/integrity","json":"/paper/2606.27180/citation-record.json","paper":"/paper/2606.27180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Proceedings of the 41st International Conference on Machine Learning , articleno =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:f83937ccd3bc12127a3b8e12ba90a3cd3a683a61108755f84ef77bde09c74145","observation_id":"c5a90018-f627-4a2d-8490-71addaefe7c7","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Deep Reinforcement Learning from Human Preferences , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:80ae75d602a3f53fe4072a3acfef987cc1a9d071c35667f04bcc4ffdff6fb5ab","observation_id":"6981270d-cbc8-481b-a0f7-da6af31aac9d","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"A Survey of Preference-Based Reinforcement Learning Methods , journal =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:03ac7f1419ccb37959e125ba6329177757145de93e04143372e88c6d3cb45b8d","observation_id":"23be9d0d-b064-4325-ab50-958c4c30b540","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Proceedings of the 38th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:e81e6b2747c55ae589789fd2a23412231d7b817a9f29740c88ec391279c6ec93","observation_id":"b1ae4516-c97a-481a-af77-bb406bcd624c","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"2024 , journal=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:d3a1ca840216a624268bbf5d337afe3a1c61ec03bbcb1beb05bde03c088b4d47","observation_id":"91273504-5c0b-465b-8ed0-93d367baa1ce","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:f1513e3260e07b3e114da28b073b13479695a317aca313e2bb73a824dc7f6873","observation_id":"507c7217-fbd6-4830-a670-b58b2b84591f","resolution":{"observed_at":"2026-07-04T13:39:51.077061Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Proceedings of the Conference on Robot Learning , pages =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:e7259b3338da1df7c4e3ddad4607b5c890a796c654a6e5a1ab2876e529fa7d6c","observation_id":"f2a50467-37fc-4ff8-8496-081b61827013","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:81cd41da843dce535160cc4ca0a73ed0b5f0fb2d03a79b39dc3872dc57ec2141","observation_id":"619cd848-645e-45ef-9a86-fcc2a7408db6","resolution":{"observed_at":"2026-07-04T13:39:51.080320Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:ac582fa0b253538eb4e0648bef246b512fc55a49db0d917b53cea403f01cdea5","observation_id":"e9326da5-3079-404c-8930-155851c2dbd2","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Proceedings of the 35th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:e534b64ea082c15c8ecb2f4bc39035318da3da126c3738b87bb2526425785a46","observation_id":"a761fe09-d5e9-477a-8dcc-baadca97aec1","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:2e5fb32105072b74dc70c6b788286f360c546b640424a18e71e9566fb9c0a067","observation_id":"568a160a-c8c9-406a-a55c-0cfb24db285e","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.939","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Navigating Noisy Feedback: Enhancing Reinforcement Learning with Error-Prone Language Models","venue":null,"work_id":"d5990b39-9697-473c-8e2b-72146e873e13","year":2024},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:dadddf777d80a934c3a90d804e75acccc7271c3b4bf9bd2a30f4d210ca89ab5a","observation_id":"3b361828-4e66-4f61-a989-0fd6e44cf6b6","resolution":{"observed_at":"2026-06-26T05:08:59.882052Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Second Agent Learning in Open-Endedness Workshop , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:9016ff8736383006ba15be363fcb942270254d4711f46d21848a02eeb66fd313","observation_id":"ec931f19-77bc-4c06-98e6-31b64e5b2350","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:25903996cfc4d59427b37c805f6b5587a0977dbf6f873b9ae56f6efe8c81576e","observation_id":"a184794b-8381-46d1-a956-b7522a02836f","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:df205980bc96e3a01f5993d3df9781390598940e869bf4fc8d2cdddd47b4748f","observation_id":"8619dc0a-1e57-4ddb-b9e9-37e600f60c77","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:454d624b11dca7cd21eda6c7e78b0e99e19f6a31898de8b350fe47149637d0ff","observation_id":"8ce25427-aa6e-4fe4-af0e-4b484e5a3d2c","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:b9defbf6761cb1d39b5eac8601ae6e8ee09f80210a13553938efe6d2c2b517f5","observation_id":"d37a5270-4a73-48a5-81ad-dcfbd3fb0fab","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"The method of paired comparisons , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:5ddb36a79b5fd2737770f7e5da66f28c8bb01315fc6344861c4c7fdd4f14cd2d","observation_id":"5f6f4cef-035a-4d35-8bc7-192c8eb364b3","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Learning to Drive a Bicycle Using Reinforcement Learning and Shaping , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:a85caa443fd7ae260f48142ae75bc4511aa593733200008875bd6a95a2214cdd","observation_id":"7693c820-ee64-4f6d-858d-252be6415899","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Learning to Utilize Shaping Rewards: A New Approach of Reward Shaping , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:a50658902ca6c829e8cb579512e5858ddd32ed6e51b9d48369d0d0ec0ce77ac8","observation_id":"43f57327-18ea-4bb6-a865-4c1829936b7b","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Self-Supervised Online Reward Shaping in Sparse-Reward Environments , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:23ac66ce67675139e9dfd3a0ba858cb428365be1898ae8bc13b9f163228b75cd","observation_id":"c26c4d52-df70-46d4-b757-921c16f9d546","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Exploration-Guided Reward Shaping for Reinforcement Learning under Sparse Rewards , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:b49bcba67aefe23a8c8193726ee00764a2d482ed5f05ef281727d32b53b00781","observation_id":"4df8d470-7027-4d1f-aa4d-e0de242dd854","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Keeping Your Distance: Solving Sparse Reward Tasks Using Self-Balancing Shaped Rewards , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:716717b13217ba0404321fd1d7adb4c5c16a33fd04d4fd4b6f57f8dec991b1d6","observation_id":"98e120fe-9577-4797-8c9f-c0a6c00aa4c5","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:55936dfe8753551e246d1221c127e145830a49d41f0cf8009f66f0f024b4d212","observation_id":"a23f3c94-5d39-4a6e-80ca-29feec58832f","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02379","last_updated":"2023-11-04T11:21:38Z","snapshot_observed_at":"2026-07-06T16:43:01.114005Z","submitted_at":"2023-11-04T11:21:38Z","title":"Accelerating Reinforcement Learning of Robotic Manipulations via Feedback from Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.02379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02379","snapshot_observed_at":"2026-07-04T13:39:51.072390Z","title":"arXiv preprint arXiv:2311.02379 , year=","venue":null,"work_id":"bcc8f2d0-0d5c-4787-bc95-ac336d933251","year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"cited_paper":"/paper/2311.02379","citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:017a4a0ff780f760fed35dea259f418027a9ff7d723d6b5e3d81a8666a04b9f7","observation_id":"fd52d7c2-a247-4c49-bd5c-1d16c946ba82","resolution":{"observed_at":"2026-07-04T13:39:51.073951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:3a56c93b96f6e662027255533feb8938cf092860ffca7f4180fabf73318b4296","observation_id":"a88b0f3f-f24b-4c11-8718-6619ae567290","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:1760ba86052eacbdd55e523b94fc72b30dd0c4b0bf3071f98bcbd0aeb07d037a","observation_id":"0d45ac87-37cd-4c73-b645-7a5a8785d060","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"2023 , editor =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:1180383f899d7f7facab275fd0e440482db003a5a636cb14cf27711055614005","observation_id":"de7751f6-c5ec-46d1-a46c-398ca12c479c","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"RoboCLIP: one demonstration is enough to learn robot policies , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:ee3d79f303bd4bb552d02d63d4106136920bbbaff56ece25cd684afadd6a5a1c","observation_id":"99bcef9c-aaf9-4e29-be44-215ed3fe687b","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"NeurIPS 2023 Foundation Models for Decision Making Workshop , year=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:d1f88de9c574882e4b176d9a6331f28107c62da5e16ea66a9be44f6cc34518bf","observation_id":"1d2ab594-3d93-47ae-a6b7-a7d8f4f522b6","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:3efced2d90c4b371dbb796f591063de56da124728bc450af94d1e55486d15204","observation_id":"790d57bd-0f69-43d0-baf0-34a365e02681","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Proceedings of The 4th Annual Learning for Dynamics and Control Conference , pages =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:49271c774b6322fa57d93a6a3fc71ffd68f4b6cad5062c16fa9a79e38617d9f7","observation_id":"1fe2e8a9-c4f5-4739-bc37-14f338b338dd","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"and Harada, Daishi and Russell, Stuart J","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:84d6b8ca0fdff94315b688309a7f6baba2c7ab268e5cf76f9e4c143e2eca672e","observation_id":"6dbe6085-588d-4ec2-b3ca-f19e83b753e2","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"International Conference on Autonomous Agents and Multiagent Systems,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:3fa607e81b3b8e49283fd118da8027c52718813973159af8a275215bbb3949cb","observation_id":"445c2649-885a-4bcf-988e-8065fd3e5f06","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Reward Shaping in Episodic Reinforcement Learning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:ddb0aea0340a15f5bf89b7edc8949274088fd98ddd44be39ddda906082ce4488","observation_id":"04eae9d2-cbd7-4400-a6a0-4de99bb5443f","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Theoretical and Empirical Analysis of Reward Shaping in Reinforcement Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:309d8cb4860e7378a40906c85d633b2341a31c56c10f07bb84c0026a69a84ef3","observation_id":"93b6797b-16f0-426a-a403-1bd2ffc41b98","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00521-024-10615-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using incomplete and incorrect plans to shape reinforcement learning in long-sequence sparse-reward tasks , journal=","venue":"Neural Computing and Applications","work_id":"ddb1044d-92d8-4a22-b158-1fb12dc4c440","year":2025},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:fd9c0678ccbd0b1b597886e4ac07c3e8b85cc15bdb964f50c2d5d7f2477b8328","observation_id":"32039695-5958-4094-8a7d-25c761da30a6","resolution":{"observed_at":"2026-06-26T05:08:59.878566Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Improving the Effectiveness of Potential-based Reward Shaping in Reinforcement Learning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:2fd3c07b77c0354d037a3b5a0170d64f8abe2cd6a51d7422098d55b60a2e5c06","observation_id":"b89ab5e7-f2c1-450d-a43e-701396f875f7","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v35i9.16935","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , author=","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"e7f35a18-8ceb-4d46-bc57-d86133fa9e88","year":2021},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:4428cbe5cdcd830ec5bbb59c37a59a4fd90d429926146bb0183dbddb48a20ca0","observation_id":"c50616e0-ff59-4aa1-8693-7b288e79c834","resolution":{"observed_at":"2026-06-26T05:08:59.880833Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"A framework for flexibly guiding learning agents , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:987ce1142c1f789aac0366a11d43bdbde337bb56d8f62d25afbb901b4a163787","observation_id":"fd4a9fb3-ec46-48da-9aba-7e05cf3c5a07","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"and Chernova, Sonia , title =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:e2d437de1aace855837e439dbae0957b37b2cf292ec7bb922b0bff01fa903f1d","observation_id":"1fa4428f-126d-4293-99ef-702030378617","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8506.2021","doi":"10.1109/icra48506.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lee, Matthew Tan, Yuke Zhu, and Jeannette Bohg","venue":null,"work_id":"fa6757b4-908a-45ef-8673-8cd2a926e54a","year":2021},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:7fe3a1d48f28e52c7f7ea81c46ac9923eb1be09ebd5ff4d744c9bfd2af7c581a","observation_id":"0059bf1e-6a67-4d99-b79e-f5a3e533058d","resolution":{"observed_at":"2026-06-26T05:08:59.879962Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"and Now\\'","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:fb8e67c2644d78be170878c054c39517b33224f9fe74257f80545fe73096adb3","observation_id":"e9d83790-eaf5-480d-bd1c-543495c8dbd6","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Proceedings of the 2023 International Conference on Autonomous Agents and Multiagent Systems , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:6ca6f4938659b177fde95814cf3e03db4d8967acf24cdb7ba4b35d2eb954386a","observation_id":"b29128ee-8241-4c6b-812b-f6f11537c1ae","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:00:24.832807Z","title":"Improving Sample Efficiency of Reinforcement Learning With Background Knowledge From Large Language Models , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-26T05:00:24.832807Z"},"links":{"citing_paper":"/paper/2606.27180"},"observation_digest":"sha256:9f90496d7022dcafee87c2c10bba1576979e7ae3878d46ffe740885dd52abf79","observation_id":"07dd6bc2-319e-4be8-bc45-158f495789ed","resolution":{"observed_at":"2026-06-26T05:00:24.832807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.27180","last_updated":"2026-06-25T15:45:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T11:23:29.060066Z","submitted_at":"2026-06-25T15:45:57Z","title":"Automating Potential-based Reward Shaping with Vision Language Model Guidance"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":38,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2606.27180."}