{"as_of":"2026-08-09T23:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86d8604eb6f2c5a56853af4b24705e34a4a274f1e9198c70fa9f6ec878d37797","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:31:10.810713Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:53:09.773129Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T05:34:40.281222Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-08-07T10:53:09.773129Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04147","last_updated":"2026-07-17T06:06:23Z","snapshot_observed_at":"2026-08-09T20:45:57.761418Z","submitted_at":"2025-06-04T16:41:55Z","title":"SLAC: Safe and Efficient Real-Robot Reinforcement Learning via Unsupervised Simulation Pre-Training","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:09.773129Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2506.04147"},"observation_digest":"sha256:a0b48cd9c56ed1a7d9821edbb413a18b20cb25892b5bcb76f24eba80fd88500e","observation_id":"9b64537e-37e9-42e4-8dd3-a89bd3ce4825","resolution":{"observed_at":"2026-08-07T10:53:09.773129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-08-06T19:53:06.350159Z","title":"Rapidly adapting policies to the real world via simulation-guided fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04452","last_updated":"2025-07-06T16:18:40Z","snapshot_observed_at":"2026-08-08T10:00:23.689092Z","submitted_at":"2025-07-06T16:18:40Z","title":"SimLauncher: Launching Sample-Efficient Real-world Robotic Reinforcement Learning via Simulation Pre-training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:53:06.350159Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2507.04452"},"observation_digest":"sha256:f42b25312c6b892b4dfdaddd8b17bca3b5d5f7ad8368775dbc1a802a206acaf3","observation_id":"c8bcfd32-6511-4a9f-ba0f-67ebe3691da3","resolution":{"observed_at":"2026-08-06T19:53:06.350159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2502.02705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rapidly adapting policies to the real world via simulation-guided fine- tuning","venue":null,"work_id":"2a9263b8-a900-4040-861c-62f87bff2840","year":2025},"citing_paper":{"arxiv_id":"2603.15759","last_updated":"2026-05-12T15:04:33Z","snapshot_observed_at":"2026-07-06T22:49:19.323519Z","submitted_at":"2026-03-16T18:00:23Z","title":"Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:03.333757Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2603.15759"},"observation_digest":"sha256:80714775be8770341a4c1977e6948d62ae0f723ee13221aaf71d14ed1f95f930","observation_id":"067fe033-1ea1-4e0c-b807-4ff601eb191c","resolution":{"observed_at":"2026-05-15T09:49:54.475351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2502.02705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rapidly adapting policies to the real world via simulation-guided fine- tuning","venue":null,"work_id":"2a9263b8-a900-4040-861c-62f87bff2840","year":2025},"citing_paper":{"arxiv_id":"2605.22123","last_updated":"2026-05-21T07:55:35Z","snapshot_observed_at":"2026-08-02T20:57:21.864024Z","submitted_at":"2026-05-21T07:55:35Z","title":"Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T05:32:17.780012Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2605.22123"},"observation_digest":"sha256:3e324508407da86a1a7d8e699a4394ef8effae2eaf51adc2e8fc93d357f50937","observation_id":"bbef72da-9f9e-42e2-be14-678f7680644e","resolution":{"observed_at":"2026-05-22T05:34:40.284030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02705","snapshot_observed_at":"2026-08-01T01:41:50.557922Z","title":"Rapidly adapting policies to the real world via simulation-guided fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25728","last_updated":"2026-07-28T13:52:12Z","snapshot_observed_at":"2026-08-09T09:28:19.957289Z","submitted_at":"2026-07-28T13:52:12Z","title":"Shared Voxel-Map-Based Cooperative Indoor UAV Guidance with a Multi-Agent Soft Actor-Critic Controller","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T01:41:50.557922Z"},"links":{"cited_paper":"/paper/2502.02705","citing_paper":"/paper/2607.25728"},"observation_digest":"sha256:03fe96aec70afd107c76cc62a3e1894ec90b1beea03bcdc6065d5fdcbc08e04c","observation_id":"b285372f-d2df-4ee9-8cb0-5417e19f5528","resolution":{"observed_at":"2026-08-01T01:41:50.557922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02705/citation-record","integrity":"/paper/2502.02705/integrity","json":"/paper/2502.02705/citation-record.json","paper":"/paper/2502.02705"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.361768Z","title":"Further suppose ∆r = max s r(s) − mins r(s) and ∆V = max s Vs(s) − mins Vs(s) are finite","venue":null,"work_id":"5aebc293-6695-4e7f-959e-d25c0357c772","year":2020},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.791377Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:fc5542ea179ce5d12a541cf46278bbe9f1a8f90eff984db5d2f84dd61719123e","observation_id":"f200afa1-4088-42b5-a626-598fb834fd70","resolution":{"observed_at":"2026-08-09T11:31:11.366765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-09T11:31:10.639789Z","title":"Randomized ensembled double q-learning: Learning fast without a model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.639789Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:dca72e09e7ef811b47b5afca03980257ae4c5e804f3e1e197ecdcca91701c772","observation_id":"ba8189ae-c835-4de2-a693-30fa28d15dae","resolution":{"observed_at":"2026-08-09T11:31:10.639789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.329214Z","title":"∞X t=0 γt¯r(st) # = V π real(s) − Vs(s0) ≥ Eρπ real(s)","venue":null,"work_id":"6ff3bade-c0b5-47bc-9991-d64b295f5609","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.800593Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:d83cbd2bfd0dee819c096fcb6e99c80f07a4205774f631ee782b441e77223dee","observation_id":"1f0ad521-36c7-459a-9c43-a803c24533e0","resolution":{"observed_at":"2026-08-09T11:31:11.334021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.00568","last_updated":"2018-12-03T06:06:25Z","snapshot_observed_at":"2026-08-05T20:04:40.605065Z","submitted_at":"2018-12-03T06:06:25Z","title":"Visual Foresight: Model-Based Deep Reinforcement Learning for Vision-Based Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.00568","snapshot_observed_at":"2026-08-09T11:31:10.660450Z","title":"Visual fore- sight: Model-based deep reinforcement learning for vision-based robotic control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.660450Z"},"links":{"cited_paper":"/paper/1812.00568","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:2ffe770729270d6b71abcf9fd896cd6a6bb5ed1654312e882ebba01efb91f4f6","observation_id":"a6374873-e67e-449d-b2f5-f380bb0fd588","resolution":{"observed_at":"2026-08-09T11:31:10.660450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12821","last_updated":"2023-05-22T08:29:00Z","snapshot_observed_at":"2026-08-01T20:31:21.496677Z","submitted_at":"2023-05-22T08:29:00Z","title":"FurnitureBench: Reproducible Real-World Benchmark for Long-Horizon Complex Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12821","snapshot_observed_at":"2026-08-09T11:31:10.671456Z","title":"org/abs/2305.12821","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.671456Z"},"links":{"cited_paper":"/paper/2305.12821","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:f00bd4bd55fe0cbb525af7ca5f1e3f75db8e6046a56002709a51bf10a16149ce","observation_id":"2d05657e-a2fc-4cb6-a6fe-7a3f97185d8c","resolution":{"observed_at":"2026-08-09T11:31:10.671456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.477961Z","title":"What went wrong? closing the sim-to-real gap via differentiable causal discovery","venue":null,"work_id":"aa63afe5-010f-45b0-a287-fb67c7f1e504","year":2023},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.682334Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:271f1cb4e3c705b0e19dc62266a766b28a5bafb0731289104494979676687ece","observation_id":"4b4e8856-c57c-45dc-9851-1db3dc103445","resolution":{"observed_at":"2026-08-09T11:31:11.482741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.463261Z","title":"RMA: rapid motor adaptation for legged robots","venue":null,"work_id":"9cb1ce5b-4619-4793-b5cc-e1055b4eef35","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.687275Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:20fb3ac25f89f27a9aae7ce2c7283a3ba489d5794d3b5d0c292336a3e0bc316d","observation_id":"31e1ca70-602d-456e-b6d9-d70ba6bdd539","resolution":{"observed_at":"2026-08-09T11:31:11.468213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06662","last_updated":"2022-03-13T14:30:55Z","snapshot_observed_at":"2026-08-03T10:21:08.313144Z","submitted_at":"2022-03-13T14:30:55Z","title":"DARA: Dynamics-Aware Reward Augmentation in Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06662","snapshot_observed_at":"2026-08-09T11:31:10.691667Z","title":"Dara: Dynamics-aware reward augmentation in offline reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.691667Z"},"links":{"cited_paper":"/paper/2203.06662","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:864bd097f46b5d47629c97ecc8e18ad9922a39dba89b42e1abbdfa0d1831e7f1","observation_id":"b420593d-7593-4074-bc39-2452b91062a2","resolution":{"observed_at":"2026-08-09T11:31:10.691667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-09T11:31:10.696945Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.696945Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:14ebdaddf0135a84a2e0cf16e3d3f0413c5e7931af32fd520ff0a67c8a9fc996","observation_id":"5819d1c4-b456-4357-947c-e70806da3f95","resolution":{"observed_at":"2026-08-09T11:31:10.696945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.447503Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning","venue":null,"work_id":"249a6887-b5e5-497f-9fd9-17e541596855","year":2021},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.702724Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:4722c542416472259b2ae87819ffc82cabc97839bccd8f3fe2c3aa422fed904f","observation_id":"5d417802-c356-4b0b-a75e-2116b30f597a","resolution":{"observed_at":"2026-08-09T11:31:11.452871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12308","last_updated":"2024-06-27T01:22:30Z","snapshot_observed_at":"2026-08-08T04:37:49.545041Z","submitted_at":"2024-04-18T16:35:38Z","title":"ASID: Active Exploration for System Identification in Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12308","snapshot_observed_at":"2026-08-09T11:31:10.707879Z","title":"URL https://doi.org/10.1177/02783649231224053","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.707879Z"},"links":{"cited_paper":"/paper/2404.12308","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:a1e0e163208ef88e96e4a0461709dd9a1390e50fae43c0a6e39431a852db285e","observation_id":"6d3a13f7-8526-4076-96b7-fd3175598aab","resolution":{"observed_at":"2026-08-09T11:31:10.707879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-09T11:31:10.713116Z","title":"Awac: Accelerating online rein- forcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.713116Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:06a99c10fb8e230034c635888fb8e36982f36302a07d13a1a58754f3829576b7","observation_id":"f607b61d-4dd9-4cce-bd01-df8e5bd3d53b","resolution":{"observed_at":"2026-08-09T11:31:10.713116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.431935Z","title":"Sim-to-real transfer of robotic control with dynamics randomization","venue":null,"work_id":"f0e053a9-d5dd-4830-a919-a78913b6d3f7","year":2018},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.718238Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:02d6bba646a8dcf6f389ddc858d7f572492eefd8ffe1904af5746d22652e7d73","observation_id":"9d664a4c-e269-4b2c-852f-a80d26a62428","resolution":{"observed_at":"2026-08-09T11:31:11.436844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.416436Z","title":"14 Published as a conference paper at ICLR 2025 Aravind Rajeswaran, Vikash Kumar, Abhishek Gupta, Giulia Vezzani, John Schulman, Emanuel Todorov, and Sergey Levine","venue":null,"work_id":"b3fcecf4-e210-4238-94f6-333e5e9f1132","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.723265Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:fdaa37d4b2dee72dc2b237449338a5e777a023a91b2e189113cd092ad6ab2f2c","observation_id":"c997893d-ca5d-4f12-8ff1-c0110fae2c31","resolution":{"observed_at":"2026-08-09T11:31:11.421532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07860","last_updated":"2022-08-16T17:37:36Z","snapshot_observed_at":"2026-08-07T07:51:14.255787Z","submitted_at":"2022-08-16T17:37:36Z","title":"A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07860","snapshot_observed_at":"2026-08-09T11:31:10.727780Z","title":"A walk in the park: Learning to walk in 20 minutes with model-free reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.727780Z"},"links":{"cited_paper":"/paper/2208.07860","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:4ee1caef83e61cc1cfd7229dd7c7a5ff09cfbf0ad193d84d2eac0193dbd0626d","observation_id":"691abc2e-98b5-4e5c-a791-9e7d5ee60c29","resolution":{"observed_at":"2026-08-09T11:31:10.727780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.397232Z","title":"Integrated architectures for learning, planning, and reacting based on approxi- mating dynamic programming","venue":null,"work_id":"8e399a47-794b-415d-a894-f0c4f0f1e24b","year":1990},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.733142Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:16ebd109f3a94284d7e0f98744467fb950962d390b7e8b98694200cc89906867","observation_id":"5172ce9e-65eb-4d46-80d5-5abb480c8306","resolution":{"observed_at":"2026-08-09T11:31:11.403276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01885","last_updated":"2024-03-26T12:59:44Z","snapshot_observed_at":"2026-08-04T13:30:35.764289Z","submitted_at":"2023-11-03T12:54:05Z","title":"Domain Randomization via Entropy Maximization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01885","snapshot_observed_at":"2026-08-09T11:31:10.742814Z","title":"Dropo: Sim-to-real transfer with offline domain randomization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.742814Z"},"links":{"cited_paper":"/paper/2311.01885","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:878112ac6cd79ca010aa8e8c3652419903de8d75791d84be69541cf7c57445ef","observation_id":"a7d09495-6b85-43a4-b46d-889e013f183d","resolution":{"observed_at":"2026-08-09T11:31:10.742814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-08-09T09:28:00.163287Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-08-09T11:31:10.753680Z","title":"URL https: //doi.org/10.48550/arXiv.2403.03949","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.753680Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:b1f098af20ce1e0bb9b2dc0584bb8e6a85f63a921b4ac7053d8b0a92cb87bcbf","observation_id":"c4fb5b0d-48b6-4735-b0cf-67483e337c62","resolution":{"observed_at":"2026-08-09T11:31:10.753680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08649","last_updated":"2019-06-20T14:13:12Z","snapshot_observed_at":"2026-07-06T08:01:41.630447Z","submitted_at":"2019-06-20T14:13:12Z","title":"Exploring Model-based Planning with Policy Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08649","snapshot_observed_at":"2026-08-09T11:31:10.759214Z","title":"Exploring model-based planning with policy networks.arXiv preprint arXiv:1906.08649,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.759214Z"},"links":{"cited_paper":"/paper/1906.08649","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:4d95396305bb13dad8c3f5598de99c87d3a1feed2a697af940ac2109d040a59f","observation_id":"2b78bf66-7275-4f0c-94a6-2e1ccaa5869e","resolution":{"observed_at":"2026-08-09T11:31:10.759214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06721","last_updated":"2022-11-18T00:17:21Z","snapshot_observed_at":"2026-07-06T13:41:38.025802Z","submitted_at":"2022-08-13T20:04:17Z","title":"Lyapunov Design for Robust and Efficient Robotic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06721","snapshot_observed_at":"2026-08-09T11:31:10.765781Z","title":"Lyapunov design for robust and efficient robotic reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.765781Z"},"links":{"cited_paper":"/paper/2208.06721","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:e8c3c50ff55f7be192b911b6b67e8d42e68f924bb44fb0eac765aef8143de441","observation_id":"27ab88ee-2b3d-42f3-8844-7d79ac2833d4","resolution":{"observed_at":"2026-08-09T11:31:10.765781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-07T14:05:45.642543Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-09T11:31:10.776502Z","title":"roboticsproceedings.org/rss13/p48.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.776502Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:4b3611092cbab869286ff1fc1ffac3b44ab4dd36f8edf93a6fde7a6bd8e30a4e","observation_id":"2bda9692-72c5-4e35-b572-8005643dc710","resolution":{"observed_at":"2026-08-09T11:31:10.776502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-08-09T11:31:10.781558Z","title":"Efficient online reinforce- ment learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.781558Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:ab2e8cd580cc2dafa58170c452b576eb1f9729624ae7216c670cc8087d65efc4","observation_id":"1ddfece0-6ab0-4aea-b6bf-7c44da3370bb","resolution":{"observed_at":"2026-08-09T11:31:10.781558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.345193Z","title":"γH Vsim(sH ) + H−1X t=1 γtr(st) − Vsim(s0) # = E γH Vsim(sH ) − γH−1Vsim(sH−1) + γH r(sH−1) + E","venue":null,"work_id":"ad33a38b-375c-423e-a7bb-29314a266ba7","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.795959Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:b9f76309e23920ef6495f925a3b1b49456a43ae31e8b99d71b7a9ba7387a5f04","observation_id":"71ae0c97-51cd-4358-a01e-b5d603cbb963","resolution":{"observed_at":"2026-08-09T11:31:11.350095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.312700Z","title":null,"venue":null,"work_id":"5146b316-0ef2-4b13-bdf2-eb9dd2aa9c66","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.805828Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:c99c568175f170d1cafc50c9d33c55df8f8b8998933d063cc56142b45b354791","observation_id":"b4f302e0-4a95-4672-83ea-5809449075c5","resolution":{"observed_at":"2026-08-09T11:31:11.317789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.289569Z","title":"We don’t train on any simulation data during real-world fine-tuning because we empirically found it didn’t help fine-tuning performance in our settings","venue":null,"work_id":"1d15430c-a4b3-404c-abc6-e2103156181e","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":1536,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.810713Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:9164f1b90ccc6d78cc02f08778a69ddd4ab8170a7190e1f1d46040fc5c6c91c5","observation_id":"4c9efcfc-060b-4a32-aa62-4a803ab023ed","resolution":{"observed_at":"2026-08-09T11:31:11.297912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:10.738072Z","title":"doi: 10.1145/122344.122377","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.738072Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:1958fc92f6e6a473fb7d23695b875e9951d95052870494cd0060b3a758c9fb10","observation_id":"ffad0629-a6c6-4468-bb3f-66938311de73","resolution":{"observed_at":"2026-08-09T11:31:10.738072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.378856Z","title":"16 Published as a conference paper at ICLR 2025 A P ROOFS Notation Recap","venue":null,"work_id":"bb7962ca-b8f1-4b21-81a3-21d5b61026bb","year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.786477Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:14f073bf5b2ee606f1c0045b9b3e37332f11f00466af9d7c826e303b7d608178","observation_id":"9fba0ee2-6ab2-40b1-a112-85f1dd30b7f9","resolution":{"observed_at":"2026-08-09T11:31:11.384997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-08-09T09:28:00.163287Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-08-09T11:31:10.747797Z","title":"Reconciling reality through simulation: A real-to-sim-to-real approach for robust ma- nipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.747797Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:d0ccd235d86582ae1bc5737eaaceb212af9e437b1049d1fd76f5d2758201dd46","observation_id":"990175b0-5743-4621-98f1-df4ffdb23c40","resolution":{"observed_at":"2026-08-09T11:31:10.747797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-07-06T16:42:53.513439Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-09T11:31:10.676629Z","title":"Imitation bootstrapped reinforcement learn- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.676629Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:e73009a4bff7f6407dcaabed22360f83a90b3c7ecdd2b1fc9d26f13d2ae2841f","observation_id":"abd4174c-d514-4e8b-9ee8-4ab1c9174b25","resolution":{"observed_at":"2026-08-09T11:31:10.676629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02868","last_updated":"2024-07-17T09:29:19Z","snapshot_observed_at":"2026-08-09T20:58:16.098576Z","submitted_at":"2024-02-05T10:30:47Z","title":"Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation Problem","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02868","snapshot_observed_at":"2026-08-09T11:31:10.771362Z","title":"Fine-tuning reinforcement learning models is secretly a forgetting mitigation problem","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.771362Z"},"links":{"cited_paper":"/paper/2402.02868","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:b7192cae7d4a855fd6a1a473505e23eb3dce8d4d7812d0bfa5c984d1a3f6a142","observation_id":"80f01451-24cf-4fe0-bae2-1284d03b69fb","resolution":{"observed_at":"2026-08-09T11:31:10.771362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13916","last_updated":"2021-04-14T23:38:31Z","snapshot_observed_at":"2026-07-06T09:32:26.221291Z","submitted_at":"2020-06-24T17:47:37Z","title":"Off-Dynamics Reinforcement Learning: Training for Transfer with Domain Classifiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13916","snapshot_observed_at":"2026-08-09T11:31:10.665872Z","title":"Off-dynamics reinforcement learning: Training for transfer with domain classifiers","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.665872Z"},"links":{"cited_paper":"/paper/2006.13916","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:cf1dcf37762e4613a45c568298f5732e74aa134dcc6d1719b42f57a575d23ea1","observation_id":"fe82fe4d-9f49-434f-9614-cfe244d6b4e6","resolution":{"observed_at":"2026-08-09T11:31:10.665872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-09T11:31:10.635032Z","title":"Mohak Bhardwaj, Sanjiban Choudhury, and Byron Boots","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.635032Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:249b25497ec272cc9cab9cd7be51bcc485024a25aed49f704b1b77dc21e8acf1","observation_id":"8c2261ac-41e5-444e-8a78-21e3ab34c1f8","resolution":{"observed_at":"2026-08-09T11:31:10.635032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11656","last_updated":"2024-05-31T16:44:06Z","snapshot_observed_at":"2026-08-09T09:28:14.392066Z","submitted_at":"2024-05-19T20:01:29Z","title":"URDFormer: A Pipeline for Constructing Articulated Simulation Environments from Real-World Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11656","snapshot_observed_at":"2026-08-09T11:31:10.645494Z","title":"Urdformer: A pipeline for constructing articulated simula- tion environments from real-world images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.645494Z"},"links":{"cited_paper":"/paper/2405.11656","citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:d6bfd69b0ed75b13437474f28180b315e243d929c5b1a6696f6099768a9ab618","observation_id":"c79dad8c-042a-4cc1-bbbc-84b1a4888474","resolution":{"observed_at":"2026-08-09T11:31:10.645494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.492566Z","title":"Yuqing Du, Olivia Watkins, Trevor Darrell, Pieter Abbeel, and Deepak Pathak","venue":null,"work_id":"99901041-a55f-4b6e-a7bd-e8a23a27b5b8","year":2022},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.655412Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:8c426e9732932ecc02b335f698224050ba5ad54ab569e677dadd7c6fddaf7d8c","observation_id":"d004ffad-3089-484b-9a69-bcc78b15ca00","resolution":{"observed_at":"2026-08-09T11:31:11.497464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:31:11.508082Z","title":"ProcTHOR: Large-scale embodied AI using procedural generation","venue":null,"work_id":"9cdc9900-4833-4070-8354-187ff031f875","year":2022},"citing_paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T11:31:10.650564Z"},"links":{"citing_paper":"/paper/2502.02705"},"observation_digest":"sha256:d998b669386204466201fd6874b3bd033d44a7ad238fb732b764d98592acf9d5","observation_id":"f868a3a1-a76a-4d96-848b-d441a5776a05","resolution":{"observed_at":"2026-08-09T11:31:11.513809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02705","last_updated":"2025-02-04T20:40:44Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T20:58:25.081665Z","submitted_at":"2025-02-04T20:40:44Z","title":"Rapidly Adapting Policies to the Real World via Simulation-Guided Fine-Tuning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 5 inbound Pith citation observations for arXiv:2502.02705."}