{"as_of":"2026-08-07T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5efeaa4fac54198ae9c163cbf55e040bc8ca9f87cff32f4b0d8561e1846b856","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:15:48.064835Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09041/citation-record","integrity":"/paper/2507.09041/integrity","json":"/paper/2507.09041/citation-record.json","paper":"/paper/2507.09041"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.13611","last_updated":"2021-05-04T19:20:46Z","snapshot_observed_at":"2026-08-06T03:14:46.253254Z","submitted_at":"2020-10-26T14:31:08Z","title":"OPAL: Offline Primitive Discovery for Accelerating Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.13611","snapshot_observed_at":"2026-08-06T18:15:42.139432Z","title":"Opal: Offline primitive discovery for acceler- ating offline reinforcement learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.139432Z"},"links":{"cited_paper":"/paper/2010.13611","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:be9aed127e446908a3ce391e8d67ec6c753678e9b4ea978f6e033b0ff5baed3b","observation_id":"ff9dbc7f-779e-41fd-89b2-78b7f97a0a6c","resolution":{"observed_at":"2026-08-06T18:15:42.139432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.821183Z","title":"pick up the cloth","venue":null,"work_id":"50f9f50f-8dfe-4a12-8d41-1b40869fcc4b","year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:48.064835Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:1b600a30062642a3882b8ff81a115842d702278140861a2de764009561d40f37","observation_id":"bfb40ee5-e43c-4cbc-b38f-6a6faa1a6810","resolution":{"observed_at":"2026-08-06T18:15:48.824409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.847227Z","title":"(2024) for goal locations","venue":null,"work_id":"5c788091-bffd-40bb-b570-a9a3eafbc5da","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.872987Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:7b769a4e17cedeb858b917cdb52d4892a2d48577dd945a6623433c3da58e81c3","observation_id":"a33d863a-8050-4f76-8902-4a36bb23ce44","resolution":{"observed_at":"2026-08-06T18:15:48.849914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T18:15:42.647136Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.647136Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ce5fc023f48feea0e6e42bd852d327c2ac421a98b3de26cc3665eb64506f94a7","observation_id":"66839269-e730-4751-a862-0c5b0834200c","resolution":{"observed_at":"2026-08-06T18:15:42.647136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T18:15:42.830579Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.830579Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:878eb2d2c2a705db8c0feb8747550908f2711d2f0e8b0fd3831581e1c9e4d090","observation_id":"73b157a3-f552-4a24-9015-be6a70485ba0","resolution":{"observed_at":"2026-08-06T18:15:42.830579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-06T18:15:42.984443Z","title":"Ex- ploration by random network distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.984443Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:655f0d962ce6566f7d73e157ece06257752117fd0e009f6b2f526dcf1b6f09a1","observation_id":"f3370e52-5772-4fed-a042-fde90e6d9f98","resolution":{"observed_at":"2026-08-06T18:15:42.984443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.01483","last_updated":"2019-03-04T18:55:24Z","snapshot_observed_at":"2026-08-02T11:19:07.941053Z","submitted_at":"2018-11-05T02:12:11Z","title":"Contingency-Aware Exploration in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.01483","snapshot_observed_at":"2026-08-06T18:15:43.135671Z","title":"Contingency-aware exploration in re- inforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.135671Z"},"links":{"cited_paper":"/paper/1811.01483","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:888f44bbf809c0eff6f6333ec44edc4817d495e4b28835c04dd857e6d4c0887e","observation_id":"02260926-b3ea-45e5-bdf7-eac5ac645540","resolution":{"observed_at":"2026-08-06T18:15:43.135671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-02T07:58:55.035919Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-06T18:15:43.645441Z","title":"L., Sutskever, I., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.645441Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:d803cf1c232c32730e093e2f6cde4f2a5681d987485f5c28f9b9a280aa06a12f","observation_id":"62fa7601-e0de-4b5f-a996-8178d3dc2b6b","resolution":{"observed_at":"2026-08-06T18:15:43.645441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15007","last_updated":"2024-11-30T18:07:50Z","snapshot_observed_at":"2026-07-06T18:49:33.987133Z","submitted_at":"2024-07-20T23:31:56Z","title":"Is Behavior Cloning All You Need? Understanding Horizon in Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15007","snapshot_observed_at":"2026-08-06T18:15:44.040995Z","title":"J., Block, A., and Misra, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.040995Z"},"links":{"cited_paper":"/paper/2407.15007","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:b5a2e6d30055c9701906f1d6c3cb8cab25f48a57726e15c8a995f6297e443c31","observation_id":"b3281106-560a-4910-a84f-1bbf866c41c7","resolution":{"observed_at":"2026-08-06T18:15:44.040995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-06T18:15:44.147549Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.147549Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:67276d31199927fa54f8ae439fca7ac7abaaabb1cb914fc71838d9db5402f667","observation_id":"81de7d67-d06f-4447-99fe-9da5621dec8e","resolution":{"observed_at":"2026-08-06T18:15:44.147549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15980","last_updated":"2024-09-27T20:10:08Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:50:19Z","title":"In-Context Imitation Learning via Next-Token Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15980","snapshot_observed_at":"2026-08-06T18:15:44.255368Z","title":"Y ., Panitch, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.255368Z"},"links":{"cited_paper":"/paper/2408.15980","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:be0fb26670c910c18a892273996f775218c117b4cd554e2c4bd9a7fc36a45ae8","observation_id":"3a451d3c-9a7d-4613-a9f6-73a530d445ea","resolution":{"observed_at":"2026-08-06T18:15:44.255368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10364","last_updated":"2022-02-04T14:03:07Z","snapshot_observed_at":"2026-07-06T12:10:16.997623Z","submitted_at":"2021-11-19T18:56:13Z","title":"Generalized Decision Transformer for Offline Hindsight Information Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10364","snapshot_observed_at":"2026-08-06T18:15:44.367192Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.367192Z"},"links":{"cited_paper":"/paper/2111.10364","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:a7a62c063b8ea5aadad007fc3a40225ea361073d36454d82c488320bd946422b","observation_id":"6ecdf627-5f25-49ee-a91b-dc225feb31c8","resolution":{"observed_at":"2026-08-06T18:15:44.367192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06088","last_updated":"2020-10-02T19:49:10Z","snapshot_observed_at":"2026-07-06T08:44:09.493337Z","submitted_at":"2019-12-12T17:26:47Z","title":"Learning to Reach Goals via Iterated Supervised Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06088","snapshot_observed_at":"2026-08-06T18:15:44.449930Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.449930Z"},"links":{"cited_paper":"/paper/1912.06088","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:c99284587feff5c95ab44a6e9a6d4fa30798c82db0d6582688b4d17da0b56efe","observation_id":"5cf61d41-82c4-49f2-a1c1-391bcedd557c","resolution":{"observed_at":"2026-08-06T18:15:44.449930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-07-06T16:42:43.992849Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-06T18:15:44.565027Z","title":"G., Rao, K., Yu, W., Fu, C., Gopalakrishnan, K., Xu, Z., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.565027Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:4afd56a19ca35e6bd85eafeee80803b102496faba6fc064cb70c9f3b769f2053","observation_id":"e5aa5d05-03f7-44da-8450-2a974ed1891d","resolution":{"observed_at":"2026-08-06T18:15:44.565027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20692","last_updated":"2024-05-31T08:38:25Z","snapshot_observed_at":"2026-07-06T18:23:10.807498Z","submitted_at":"2024-05-31T08:38:25Z","title":"In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20692","snapshot_observed_at":"2026-08-06T18:15:44.651513Z","title":"In-context decision transformer: Reinforcement learn- ing via hierarchical chain-of-thought","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.651513Z"},"links":{"cited_paper":"/paper/2405.20692","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:3de06321c4b22493f4dbf8a50be957c07c2ec5efe0e25c17f2b5ae24bf4509b7","observation_id":"146d1b07-f47b-41ed-b931-18e4a43e4af0","resolution":{"observed_at":"2026-08-06T18:15:44.651513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.02934","last_updated":"2020-05-06T16:14:48Z","snapshot_observed_at":"2026-07-06T09:18:09.794978Z","submitted_at":"2020-05-06T16:14:48Z","title":"Learning Adaptive Exploration Strategies in Dynamic Environments Through Informed Policy Regularization","version":1},"cited_work":{"arxiv_id":"2005.02934","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.02934","snapshot_observed_at":"2026-08-06T18:15:48.642557Z","title":"Learning Adaptive Exploration Strategies in Dynamic Environments Through Informed Policy Regularization","venue":"cs.LG","work_id":"b1d25184-6446-47a1-9569-47b7d382bbac","year":2020},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.741297Z"},"links":{"cited_paper":"/paper/2005.02934","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:102d2394e0ceaebf5e6093980b8b52d1e759bcd6dbb65432f462d2482f2636df","observation_id":"795ba928-5177-4043-8b71-db7f03c7de79","resolution":{"observed_at":"2026-08-06T18:15:48.645862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T18:15:44.853558Z","title":"J., Pertsch, K., Karamcheti, S., Xiao, T., Balakr- ishna, A., Nair, S., Rafailov, R., Foster, E., Lam, G., San- keti, P., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.853558Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ff0c2533ba552c3f61e5593ca96eccb5803b34386881f49c57823a3809bccf0b","observation_id":"7470a545-9737-4273-805f-66e7c31b818c","resolution":{"observed_at":"2026-08-06T18:15:44.853558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15371","last_updated":"2024-10-28T19:55:46Z","snapshot_observed_at":"2026-07-06T17:49:07.589781Z","submitted_at":"2024-03-22T17:50:43Z","title":"Can large language models explore in-context?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15371","snapshot_observed_at":"2026-08-06T18:15:44.938881Z","title":"J., Zhang, C., and Slivkins, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:44.938881Z"},"links":{"cited_paper":"/paper/2403.15371","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:edd8d31205adbb36cbe27b9749c93873fafe164af0cd3e9968a7b9980997627b","observation_id":"097a55a6-5e4c-4383-bec7-b4b810126b6f","resolution":{"observed_at":"2026-08-06T18:15:44.938881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-07-06T08:47:53.346676Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-06T18:15:45.032209Z","title":"B., and Levine, S","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.032209Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:060f34da2796f039b411a69e5a172c4e42e33d9a5daff27e09eba93920a139c0","observation_id":"0e7ef5bb-d240-44de-ad57-dd99ce411702","resolution":{"observed_at":"2026-08-06T18:15:45.032209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14215","last_updated":"2022-10-25T17:57:49Z","snapshot_observed_at":"2026-07-06T14:10:20.983444Z","submitted_at":"2022-10-25T17:57:49Z","title":"In-context Reinforcement Learning with Algorithm Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14215","snapshot_observed_at":"2026-08-06T18:15:45.169185Z","title":"In-context reinforcement learning with algorithm distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.169185Z"},"links":{"cited_paper":"/paper/2210.14215","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:75cca567530102b5fa452fc06b4255fe47d56d235a40d010edf920c8b4313921","observation_id":"afbb608b-4a04-491f-af7c-92af6364fc93","resolution":{"observed_at":"2026-08-06T18:15:45.169185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01112","last_updated":"2021-05-06T09:06:50Z","snapshot_observed_at":"2026-08-05T12:38:48.463149Z","submitted_at":"2020-10-02T17:13:39Z","title":"FOCAL: Efficient Fully-Offline Meta-Reinforcement Learning via Distance Metric Learning and Behavior Regularization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01112","snapshot_observed_at":"2026-08-06T18:15:45.214018Z","title":"S., Lee, L., Free- man, D., Guadarrama, S., Fischer, I., Xu, W., Jang, E., Michalewski, H., et al","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.214018Z"},"links":{"cited_paper":"/paper/2010.01112","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:a9faad9de75cbe2a6b8527f1da482a8953005b768f89cec5603c9d3bcafd507c","observation_id":"bb7ae660-7817-463a-8d44-e2a7774f8a8a","resolution":{"observed_at":"2026-08-06T18:15:45.214018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-06T18:15:45.355493Z","title":"What matters in learning from offline human demonstrations for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.355493Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:9e76cd67e62e97479b8b3a0041a9cc44c16408d98f59d40d9fb158337923b3dc","observation_id":"60e2fd1a-701e-4aba-b631-6bbda861eacf","resolution":{"observed_at":"2026-08-06T18:15:45.355493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.03141","last_updated":"2018-02-25T04:55:20Z","snapshot_observed_at":"2026-07-06T05:50:35.749193Z","submitted_at":"2017-07-11T06:21:31Z","title":"A Simple Neural Attentive Meta-Learner","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.03141","snapshot_observed_at":"2026-08-06T18:15:45.523780Z","title":"A simple neural attentive meta-learner","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.523780Z"},"links":{"cited_paper":"/paper/1707.03141","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:4e431f5db7936e6dfae14731b7f4ae444ad671dc6cfb51147f25174ce1211c33","observation_id":"d485db85-a976-405f-82ee-fd8afe773c72","resolution":{"observed_at":"2026-08-06T18:15:45.523780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06238","last_updated":"2025-07-14T15:16:18Z","snapshot_observed_at":"2026-07-06T19:29:55.838200Z","submitted_at":"2024-10-08T17:54:03Z","title":"EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06238","snapshot_observed_at":"2026-08-06T18:15:45.636586Z","title":"N., Chi, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.636586Z"},"links":{"cited_paper":"/paper/2410.06238","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:7b1e31a834fb6fad48418023fa713f1d252c73b4d85e31c3f72e96d68710abe5","observation_id":"372ff9fe-6ebd-42de-9587-a664a68c9133","resolution":{"observed_at":"2026-08-06T18:15:45.636586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02276","last_updated":"2024-11-04T23:33:38Z","snapshot_observed_at":"2026-07-30T23:36:30.273084Z","submitted_at":"2023-07-05T13:20:21Z","title":"First-Explore, then Exploit: Meta-Learning to Solve Hard Exploration-Exploitation Trade-Offs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02276","snapshot_observed_at":"2026-08-06T18:15:45.786311Z","title":"and Clune, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.786311Z"},"links":{"cited_paper":"/paper/2307.02276","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:152018820ab2bd077bdce6d6ca566a29d3f185073af300de6df581ce07b3a3d3","observation_id":"c3267b21-5bd8-48f9-92da-3b1fa1e45fc1","resolution":{"observed_at":"2026-08-06T18:15:45.786311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15567","last_updated":"2024-05-26T17:44:52Z","snapshot_observed_at":"2026-08-07T05:14:40.258185Z","submitted_at":"2024-02-23T19:09:10Z","title":"Foundation Policies with Hilbert Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15567","snapshot_observed_at":"2026-08-06T18:15:45.975166Z","title":"Foundation policies with hilbert representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.975166Z"},"links":{"cited_paper":"/paper/2402.15567","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:2e63c9149dc14cc8bf14b7b58e30c9fc0f2ae1a24704caf404ff78098cee26d3","observation_id":"31f13b59-f076-4a7f-a5c8-cc8841759093","resolution":{"observed_at":"2026-08-06T18:15:45.975166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.871710Z","title":"Vision-based multi-task manipulation for inexpen- sive robots using end-to-end learning from demonstration","venue":null,"work_id":"e3ddc4c5-778c-4b6e-a069-c75b78fbf265","year":2018},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.166468Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:92aad02a2eb20f135374c07069ffb114f24b81053a698cb21f63da60fe3cd46d","observation_id":"7d2c65f9-3f61-4edb-9214-fe45be52d940","resolution":{"observed_at":"2026-08-06T18:15:48.875551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03801","last_updated":"2023-12-06T15:19:28Z","snapshot_observed_at":"2026-08-02T14:22:22.861434Z","submitted_at":"2023-12-06T15:19:28Z","title":"Generalization to New Sequential Decision Making Tasks with In-Context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03801","snapshot_observed_at":"2026-08-06T18:15:46.321234Z","title":"C., Hambro, E., Kirk, R., Henaff, M., and Raileanu, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.321234Z"},"links":{"cited_paper":"/paper/2312.03801","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:aca8644145a5d3696593328c674e1b2120f0823bb495fdfba086344adc199625","observation_id":"90ae909b-c04a-42ea-9f25-23998aeb6cb4","resolution":{"observed_at":"2026-08-06T18:15:46.321234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07071","last_updated":"2025-08-13T15:48:10Z","snapshot_observed_at":"2026-08-06T21:10:35.884042Z","submitted_at":"2024-10-09T17:15:30Z","title":"Retrieval-Augmented Decision Transformer: External Memory for In-context RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07071","snapshot_observed_at":"2026-08-06T18:15:46.599472Z","title":"Retrieval-augmented de- cision transformer: External memory for in-context rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.599472Z"},"links":{"cited_paper":"/paper/2410.07071","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:813d57504ce0a7e6c45097bfdc633cc6a502034a9376cdc8d32c78dafe41cffd","observation_id":"b162da14-636e-4fba-9f92-63a13628a46d","resolution":{"observed_at":"2026-08-06T18:15:46.599472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10024","last_updated":"2020-11-19T18:47:40Z","snapshot_observed_at":"2026-07-06T10:16:10.292063Z","submitted_at":"2020-11-19T18:47:40Z","title":"Parrot: Data-Driven Behavioral Priors for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.10024","snapshot_observed_at":"2026-08-06T18:15:46.657876Z","title":"Parrot: Data-driven behavioral priors for re- inforcement learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.657876Z"},"links":{"cited_paper":"/paper/2011.10024","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:65ea5fd542d81b7b64f3a0771f0f216657723968a25d4246321b09c8227971e2","observation_id":"0f89f866-955c-4bf4-ba38-85ca2722bb14","resolution":{"observed_at":"2026-08-06T18:15:46.657876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-06T18:15:46.817188Z","title":"K., Shyam, P., Mutz, F., Ja´skowski, W., and Schmidhuber, J","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.817188Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:d8cf3cdf84c79de059c6412a9f6f58e5973c883d6b4ce80cc2371c6ebe066a8d","observation_id":"325a3a7e-8201-4ff1-971f-797eabf7a0e8","resolution":{"observed_at":"2026-08-06T18:15:46.817188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.00814","last_updated":"2015-11-19T22:40:30Z","snapshot_observed_at":"2026-08-01T13:17:26.224723Z","submitted_at":"2015-07-03T04:11:15Z","title":"Incentivizing Exploration In Reinforcement Learning With Deep Predictive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.00814","snapshot_observed_at":"2026-08-06T18:15:46.931088Z","title":"C., Levine, S., and Abbeel, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.931088Z"},"links":{"cited_paper":"/paper/1507.00814","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:f29f0bc98bb2c2ea1970da0cdf3ee7e1420a5cc4fed6fdb91a1e6d03daa55723","observation_id":"9059c91a-0a62-442c-b61d-efe17c856aa9","resolution":{"observed_at":"2026-08-06T18:15:46.931088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T18:15:47.007830Z","title":"M., Ghosh, D., Walke, H., Pertsch, K., Black, K., Mees, O., Dasari, S., Hejna, J., Kreiman, T., Xu, C., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.007830Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:8ff4747f703ab95762262b88a880fd95da5824b7f9b76d6ede422e032de149b4","observation_id":"cddd209a-35af-4400-a6df-c07c7af80026","resolution":{"observed_at":"2026-08-06T18:15:47.007830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05763","last_updated":"2017-01-23T12:38:24Z","snapshot_observed_at":"2026-07-06T05:19:05.390653Z","submitted_at":"2016-11-17T16:29:11Z","title":"Learning to reinforcement learn","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05763","snapshot_observed_at":"2026-08-06T18:15:47.096413Z","title":"X., Kurth-Nelson, Z., Tirumala, D., Soyer, H., Leibo, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.096413Z"},"links":{"cited_paper":"/paper/1611.05763","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:5ff2c47fa3ab9f7a5c18da0c76e8b07a7d2463ce71a8507053504c1b535eed86","observation_id":"b03a66d1-6948-4f7c-bda9-e273d4799f61","resolution":{"observed_at":"2026-08-06T18:15:47.096413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18076","last_updated":"2025-07-11T20:30:30Z","snapshot_observed_at":"2026-07-06T19:38:35.617923Z","submitted_at":"2024-10-23T17:58:45Z","title":"Leveraging Skills from Unlabeled Prior Data for Efficient Online Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18076","snapshot_observed_at":"2026-08-06T18:15:47.138620Z","title":"Leverag- ing skills from unlabeled prior data for efficient online exploration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.138620Z"},"links":{"cited_paper":"/paper/2410.18076","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:4613f338682d928f75c393365b8bd1849c79c2e7ba18672d603ec9e9a8ab040b","observation_id":"33a8a429-6049-4687-997f-bd57fc282f9c","resolution":{"observed_at":"2026-08-06T18:15:47.138620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24108","last_updated":"2024-10-31T16:38:51Z","snapshot_observed_at":"2026-08-02T15:33:41.123497Z","submitted_at":"2024-10-31T16:38:51Z","title":"Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers","version":1},"cited_work":{"arxiv_id":"2410.24108","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.24108","snapshot_observed_at":"2026-08-06T18:15:48.374816Z","title":"Reinforcement Learning Gradients as Vitamin for Online Finetuning Decision Transformers","venue":"cs.LG","work_id":"430927d8-2085-4b23-9c0d-9354059015f5","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.237851Z"},"links":{"cited_paper":"/paper/2410.24108","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:5fd95666bd1e613bf068713577e15b45ef43cbb4d306265d785010697d9048c9","observation_id":"51883d58-9c0a-4517-8a96-8cde8c78d085","resolution":{"observed_at":"2026-08-06T18:15:48.433440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00935","last_updated":"2025-08-28T20:06:01Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T08:25:12Z","title":"Policy Expansion for Bridging Offline-to-Online Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00935","snapshot_observed_at":"2026-08-06T18:15:47.326956Z","title":"Policy expansion for bridging offline-to-online reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.326956Z"},"links":{"cited_paper":"/paper/2302.00935","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:50f605e7e09e09c1bef3a113bf39e94e1fe447648b8de0260111443824403115","observation_id":"fb9ce7a3-292d-4538-8c65-9aa20660a83d","resolution":{"observed_at":"2026-08-06T18:15:47.326956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.08170","last_updated":"2021-11-12T03:15:55Z","snapshot_observed_at":"2026-07-06T09:29:05.834368Z","submitted_at":"2020-06-15T06:56:18Z","title":"MetaCURE: Meta Reinforcement Learning with Empowerment-Driven Exploration","version":5},"cited_work":{"arxiv_id":"2006.08170","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.08170","snapshot_observed_at":"2026-08-06T18:15:48.195790Z","title":"MetaCURE: Meta Reinforcement Learning with Empowerment-Driven Exploration","venue":"cs.AI","work_id":"bb9ae292-243c-4e81-ae29-eddffa7e2cbb","year":2020},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.417541Z"},"links":{"cited_paper":"/paper/2006.08170","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:c4aca7ad45c237ebc3d24d848332f0f4cf86e20ea6cfa01b8b15295c39ebc143","observation_id":"37cdd30f-d2f3-4461-bc4f-23ce09c7276c","resolution":{"observed_at":"2026-08-06T18:15:48.248660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.863650Z","title":"Deep imitation learning for complex manipulation tasks from virtual reality teleoper- ation","venue":null,"work_id":"5bdc84cb-5bfa-492d-84b6-b5188a919015","year":2018},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.503432Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:8124e7c526310bab06ce201d1cf5fe7d558561e2afbe043e4ad23ef03bc9ea6d","observation_id":"61531bc1-3052-4de8-9495-2fb6aac61881","resolution":{"observed_at":"2026-08-06T18:15:48.866571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T18:15:47.590155Z","title":"Z., Kumar, V ., Levine, S., and Finn, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.590155Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:4acec44287aa8eed97f2a0270b9f43273db995719391f49afe0c19b215af5d34","observation_id":"c881c136-71dd-4d68-a29d-aef1647de061","resolution":{"observed_at":"2026-08-06T18:15:47.590155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20635","last_updated":"2024-10-15T17:54:17Z","snapshot_observed_at":"2026-07-06T18:53:49.470914Z","submitted_at":"2024-07-30T08:26:44Z","title":"Autonomous Improvement of Instruction Following Skills via Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20635","snapshot_observed_at":"2026-08-06T18:15:47.644692Z","title":"Autonomous improvement of instruction 14 Behavioral Exploration: Learning to Explore via In-Context Adaptation following skills via foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.644692Z"},"links":{"cited_paper":"/paper/2407.20635","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:b25bd8e93e9f02d99da9ec4593879758a17f49f36fa6de3b6bb06cb8dbee65e4","observation_id":"30bce4b7-83b7-4c2e-9f98-f9490b17a353","resolution":{"observed_at":"2026-08-06T18:15:47.644692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08348","last_updated":"2020-02-27T19:40:21Z","snapshot_observed_at":"2026-08-05T00:23:41.510866Z","submitted_at":"2019-10-18T11:44:59Z","title":"VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.08348","snapshot_observed_at":"2026-08-06T18:15:47.730302Z","title":"Varibad: A very good method for bayes-adaptive deep rl via meta-learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.730302Z"},"links":{"cited_paper":"/paper/1910.08348","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ca06e5c85ad09222fbf184214f679c71afd61fc543e0087a2f2a593efeadb992","observation_id":"2603762d-7459-40a6-8dc3-8993e2926b9a","resolution":{"observed_at":"2026-08-06T18:15:47.730302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.855117Z","title":"The inner induction then immediately implies the outer induction step, that we reach a terminal state at episode k in ¯C t β, so that | ¯C t+1 β | = nβ − t","venue":null,"work_id":"9c4aa1bd-5cc9-4072-b8e5-9824454fe638","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.803849Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:a452cc9c466db3f64b4f5fc00237d375cd5766999d48f881931e3ae91aec2cf8","observation_id":"b4dfb3dd-112e-4bf5-8a52-9338548a61f1","resolution":{"observed_at":"2026-08-06T18:15:48.858265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.829858Z","title":"For each task, we run with a horizon of 300 steps, and utilize the environment’s built-in success detector","venue":null,"work_id":"244e1361-d50f-4f42-949a-6946872f8199","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.983379Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:535f304d1d399dd172e87a529bd349980799eca389206129d4cb08465afb9133","observation_id":"8279da63-2fac-4666-8a87-b6f5a0b2b396","resolution":{"observed_at":"2026-08-06T18:15:48.832832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.838890Z","title":"As stated in the text, we evaluate based on the number of goals reached (for Antmaze) or tasks completed (for Kitchen)","venue":null,"work_id":"4b565d3c-4bcc-4ba4-8e6c-bd6171ec3449","year":2024},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":750,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:47.929647Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:6bf71179a5174eff2442de2f9d4ac901c04c5f9e66f5b54e14e19bf5fbe66b84","observation_id":"0e00e78e-59f9-4e07-9a8b-919e2d910c44","resolution":{"observed_at":"2026-08-06T18:15:48.841677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:48.880815Z","title":"K., Yu, T., Singh, A., Phielipp, M., and Finn, C","venue":null,"work_id":"e7f12341-6b45-45c3-98d9-310d912ad7cd","year":2021},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.103102Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:eebab4b331b24bd5d9869ac94c3e99500fb20519980335c47c754b918f524b09","observation_id":"06bbb158-007c-4972-8b65-d89688b22d1e","resolution":{"observed_at":"2026-08-06T18:15:48.883292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-06T05:45:23.347318Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-06T18:15:46.469662Z","title":"Reinforcement learning upside down: Don’t predict rewards–just map them to actions","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.469662Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:c64072fa4144b69facd76b1b8d39bb30c3600f17c2bee0cdeabdf00ad9c3f325","observation_id":"159f7b58-4c8a-4f70-9822-cd365b443697","resolution":{"observed_at":"2026-08-06T18:15:46.469662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-06T18:15:42.438704Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.438704Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:13f58ba6e7b10b11a608c9ec0044771b0f0931b4d4dee15e8a8d4d1dfb853c54","observation_id":"16687d6b-fc2d-4674-b27c-a41e40e5c70b","resolution":{"observed_at":"2026-08-06T18:15:42.438704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-07-06T07:30:05.397042Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-06T18:15:43.839731Z","title":"O., and Clune, J","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.839731Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ccbc96ee186bf3e2e266513789848cdedb012a3972046d11b2f74f7146eef202","observation_id":"8dece67f-c87a-4143-9c04-e5050612bac0","resolution":{"observed_at":"2026-08-06T18:15:43.839731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10047","last_updated":"2022-12-15T23:47:39Z","snapshot_observed_at":"2026-07-06T14:07:19.717932Z","submitted_at":"2022-10-18T17:59:55Z","title":"From Play to Policy: Conditional Behavior Generation from Uncurated Robot Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10047","snapshot_observed_at":"2026-08-06T18:15:43.348787Z","title":"Can foundation models perform zero-shot task specifi- cation for robot manipulation? In Learning for dynamics and control conference, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.348787Z"},"links":{"cited_paper":"/paper/2210.10047","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:32bae86b9f0ff17cb5c76617c0ed24f8ea50ce88cf1faf91c72947560551a47b","observation_id":"5fec2223-9cf7-4aae-bf45-4ed6b797c76e","resolution":{"observed_at":"2026-08-06T18:15:43.348787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10751","last_updated":"2022-05-11T03:17:44Z","snapshot_observed_at":"2026-08-02T17:34:08.290568Z","submitted_at":"2021-12-20T18:55:16Z","title":"RvS: What is Essential for Offline RL via Supervised Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10751","snapshot_observed_at":"2026-08-06T18:15:43.933445Z","title":"Rvs: What is essential for offline rl via supervised learn- ing? arXiv preprint arXiv:2112.10751,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.933445Z"},"links":{"cited_paper":"/paper/2112.10751","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:06505585b0f8fa1859f535d2b7de9c7c2eb8c22084e3164b56c38b1367928dbe","observation_id":"77a78522-f49a-4eb8-96e5-bd86295f3c90","resolution":{"observed_at":"2026-08-06T18:15:43.933445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15657","snapshot_observed_at":"2026-08-06T18:15:42.188468Z","title":"Is conditional generative model- ing all you need for decision-making? arXiv preprint arXiv:2211.15657,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.188468Z"},"links":{"cited_paper":"/paper/2211.15657","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:eb1da32b759bc7a09f37088dc19e5b483476b58cbb9cc7084cbb1abd90f2ed69","observation_id":"4b748d70-c76a-49c1-86d5-ffaa173c1a62","resolution":{"observed_at":"2026-08-06T18:15:42.188468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10088","last_updated":"2024-10-14T02:02:54Z","snapshot_observed_at":"2026-08-04T09:34:09.818156Z","submitted_at":"2024-10-14T02:02:54Z","title":"The Ingredients for Robotic Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10088","snapshot_observed_at":"2026-08-06T18:15:43.506860Z","title":"K., and Levine, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:43.506860Z"},"links":{"cited_paper":"/paper/2410.10088","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:afd24117cf0701a66f8104356c1207f9f4c30a3bd5381079a91a9bda2daac4f1","observation_id":"ef579c6d-ab4d-43b3-84fd-1ee3b1709d66","resolution":{"observed_at":"2026-08-06T18:15:43.506860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:15:42.885629Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.885629Z"},"links":{"citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:87178d3c3d0b5be2c3c7c506b300d62ae124618b24b6d147051d7a606759cb29","observation_id":"eedd4742-33fe-498b-9d80-465effa9fd62","resolution":{"observed_at":"2026-08-06T18:15:42.885629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-06T07:16:48.853653Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-06T18:15:42.311817Z","title":"Z., Xiong, Z., Zintgraf, L., Finn, C., and Whiteson, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.311817Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:209c9f61b6abf6612b71baf86091e77e737e70b5913413e13f746bf010d858b1","observation_id":"225f2833-5557-4fcc-893b-3bf91fd56b0f","resolution":{"observed_at":"2026-08-06T18:15:42.311817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07316","last_updated":"2016-04-25T16:03:56Z","snapshot_observed_at":"2026-07-06T04:53:59.754200Z","submitted_at":"2016-04-25T16:03:56Z","title":"End to End Learning for Self-Driving Cars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.07316","snapshot_observed_at":"2026-08-06T18:15:42.747298Z","title":"End to end learning for self-driving cars","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.747298Z"},"links":{"cited_paper":"/paper/1604.07316","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:bc7ea4b795096c7e722abe83803a4990a10efec52deec061bf0002fb68e6ad37","observation_id":"3754c8bc-55be-473a-b402-3f05da810bf7","resolution":{"observed_at":"2026-08-06T18:15:42.747298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-06T18:15:42.529366Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.529366Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:23149bd57b51bbb74150bf162fba350cf32be48d05bbf4a1a5a4a8a9575d2cec","observation_id":"1029ab3b-869a-4882-a489-959be1ab0268","resolution":{"observed_at":"2026-08-06T18:15:42.529366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":3,"verified_fuzzy":8},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2507.09041."}