{"as_of":"2026-08-11T19:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fb10778dcf3076e28f384ec46b4876240ce513d96965e78d6d0aca241decc5a","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:03:34.319088Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.12363/citation-record","integrity":"/paper/2510.12363/integrity","json":"/paper/2510.12363/citation-record.json","paper":"/paper/2510.12363"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T10:03:27.741507Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:27.741507Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:de0c5549b713553df845f133e4ab9d2888d0ba3db7da88611d8451e5d9722e38","observation_id":"f15addc7-28da-460f-b71d-971be214492b","resolution":{"observed_at":"2026-08-04T10:03:27.741507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:27.934564Z","title":"Learning markov state abstractions for deep reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:27.934564Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:d68851ecf7872662a1ce8c0839b8baf65af94a7d4b2f673e82cc9007f1d1e39f","observation_id":"2affba33-b178-456a-94eb-b934c1f5b208","resolution":{"observed_at":"2026-08-04T10:03:27.934564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:28.112596Z","title":"Pedipulate: Enabling Manipulation Skills using a Quadruped Robot 's Leg , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:28.112596Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:834438b8f04a38de77e85ac7762398c65d9b138dafbdcbff40d2a4da2bfcf44d","observation_id":"c9f7fe64-278c-4da5-8650-2a6a0b25df32","resolution":{"observed_at":"2026-08-04T10:03:28.112596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:28.249358Z","title":"Scaling mlps: A tale of inductive bias","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:28.249358Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:b4e9f2d142a0c1d314c9b69d8138600de461ac7cbedf14adfcdfa8c3f21411ed","observation_id":"ef68a4bb-1729-4e5d-85f4-cd39121c6e7c","resolution":{"observed_at":"2026-08-04T10:03:28.249358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05331","last_updated":"2025-07-07T17:56:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:56:01Z","title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05331","snapshot_observed_at":"2026-08-04T10:03:28.316077Z","title":"A careful examination of large behavior models for multitask dexterous manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:28.316077Z"},"links":{"cited_paper":"/paper/2507.05331","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:e2054fd50fe171e42067efde338d6d9386eb2ce2924577e673fbbb0c24bd0d85","observation_id":"80327dcc-2f64-48fe-b0db-a5206da5b4be","resolution":{"observed_at":"2026-08-04T10:03:28.316077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:28.430158Z","title":"Dario Bellicoso, Koen Krämer, Markus Stäuble, Dhionis Sako, Fabian Jenelten, Marko Bjelonic, and Marco Hutter","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:28.430158Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:768dc73750f68ebb3f0dce31d91ece5e00878570cc04da5b1d1bdcbc1177446c","observation_id":"b07a8e93-b328-4795-96e7-077d6dc56b0b","resolution":{"observed_at":"2026-08-04T10:03:28.430158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T10:03:28.554612Z","title":"pi 0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:28.554612Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:8ebf9718ecb60a7675f0c838991e187bd3e71ae5e51b330844cba7cbb8c7ce3e","observation_id":"e5795325-1ce7-43c4-8afd-fea62184fc21","resolution":{"observed_at":"2026-08-04T10:03:28.554612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:28.674648Z","title":"RT -2: Vision - Language - Action Models Transfer Web Knowledge to Robotic Control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:28.674648Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:65c0a7150cfa4be18cf07f4d5dfa45e6d943ff5ea85044e1526de0c6d51af619","observation_id":"3514963b-92f6-4a69-99f2-bd323b52994a","resolution":{"observed_at":"2026-08-04T10:03:28.674648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17618","last_updated":"2025-06-23T00:56:21Z","snapshot_observed_at":"2026-07-06T18:20:52.408832Z","submitted_at":"2024-05-27T19:28:33Z","title":"Symmetric Reinforcement Learning Loss for Robust Learning on Diverse Tasks and Model Scales","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17618","snapshot_observed_at":"2026-08-04T10:03:28.803985Z","title":"Symmetric reinforcement learning loss for robust learning on diverse tasks and model scales","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:28.803985Z"},"links":{"cited_paper":"/paper/2405.17618","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:eff68935b7e1204c9a0c333c2ab81b61841542446df5d34907acb5b648b4377e","observation_id":"c592f4f9-47c4-4a93-a14a-e06d16c38e58","resolution":{"observed_at":"2026-08-04T10:03:28.803985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:28.919419Z","title":"Learning quadrupedal locomotion on deformable terrain","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:28.919419Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:1c58eaec395f85ad365a5d0e54195b38ea75bae4b5bd2d048431dab886cf9e0b","observation_id":"7f716a29-44bd-4cbd-b1ff-2b30ce74574c","resolution":{"observed_at":"2026-08-04T10:03:28.919419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:29.008153Z","title":"Transfer from Simulation to Real World through Learning Deep Inverse Dynamics Model , 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:29.008153Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:e14ad4d9037c3032c3cf3cd63565f0d13f5a6221478a6690292aa1b6c900cf7b","observation_id":"0e3d4d30-45c6-4df2-a7f1-e33638c2408f","resolution":{"observed_at":"2026-08-04T10:03:29.008153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:29.150862Z","title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:29.150862Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:996917c3b984c01b5d83086af42bddf6739d2539fcd47e72b6adc426cab1a5fc","observation_id":"e7b80cc8-74d3-4886-baea-b64c506064ab","resolution":{"observed_at":"2026-08-04T10:03:29.150862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:29.312751Z","title":"Efficient model-based reinforcement learning through optimistic policy search and planning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:29.312751Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:d08eb4802e6f3450ccff2edecc1b0de91bba04d25aaaed5b009d867b4df4450a","observation_id":"16ba2e58-1971-48ef-8948-a52e7b83341a","resolution":{"observed_at":"2026-08-04T10:03:29.312751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:29.476493Z","title":"BERT : Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:29.476493Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:acd49edc61c4108b7b40fd940b530c2a93d9e700d2e0394ce2b9c9acf7740a47","observation_id":"edaf0117-a842-4c2e-86fd-223adf5a3d99","resolution":{"observed_at":"2026-08-04T10:03:29.476493Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:29.586681Z","title":"Roloma: Robust loco-manipulation for quadruped robots with arms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:29.586681Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:62bf5dac5110878f48310023494f8b18a753527c7ae574dbc9026f76bab8ab26","observation_id":"ac754f07-fbaa-4e61-a25c-35c30c927275","resolution":{"observed_at":"2026-08-04T10:03:29.586681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:29.667876Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:29.667876Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:792b2cab770ddde66c508486e22588cc1cdb5e38f713f621ed3e2c76426c9563","observation_id":"b5b79247-7cdd-428f-a2c6-7c0e617fe6c7","resolution":{"observed_at":"2026-08-04T10:03:29.667876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:29.744272Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:29.744272Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:b139398672e8459eef0a9f55fc23b3cfcf6c229d261226ce8de2e04d24b10b5c","observation_id":"41482c13-611f-48bf-a375-14c43c80edf8","resolution":{"observed_at":"2026-08-04T10:03:29.744272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:29.849265Z","title":"ANYmal Parkour : Learning Agile Navigation for Quadrupedal Robots , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:29.849265Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:7d2c5ed1548a1cd8caeaa059f8ca89baad965cef6d4e68cf6875d91ca22f53b0","observation_id":"5594a5f6-a13f-4886-a309-84a9f27e46e1","resolution":{"observed_at":"2026-08-04T10:03:29.849265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:29.953190Z","title":"Dario Bellicoso, Vassilios Tsounis, Jemin Hwangbo, Karen Bodie, Peter Fankhauser, Michael Bloesch, Remo Diethelm, Samuel Bachmann, Amir Melzer, and Mark Hoepflinger","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:29.953190Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:7e9253979b3b11d38adc06faca7d3956bfad0add1f8d8a4f02a23bd3743bf265","observation_id":"6340f53c-ba44-446c-9a66-8a8d01786479","resolution":{"observed_at":"2026-08-04T10:03:29.953190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08652","last_updated":"2019-01-24T21:50:29Z","snapshot_observed_at":"2026-07-06T07:28:54.617767Z","submitted_at":"2019-01-24T21:50:29Z","title":"Learning agile and dynamic motor skills for legged robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.08652","snapshot_observed_at":"2026-08-04T10:03:30.089031Z","title":"Learning agile and dynamic motor skills for legged robots","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.089031Z"},"links":{"cited_paper":"/paper/1901.08652","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:fb99616d28ded3e4a56d61eec6e28b5df20427117cfcca46bebbd3e4d025c94a","observation_id":"669f2f07-67dd-4779-bbc0-846e3ae63956","resolution":{"observed_at":"2026-08-04T10:03:30.089031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.00815","last_updated":"2021-07-16T02:45:23Z","snapshot_observed_at":"2026-07-06T10:37:23.996401Z","submitted_at":"2021-02-01T13:13:58Z","title":"Bellman Eluder Dimension: New Rich Classes of RL Problems, and Sample-Efficient Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.00815","snapshot_observed_at":"2026-08-04T10:03:30.180905Z","title":"Bellman eluder dimension: New rich classes of rl problems, and sample-efficient algorithms, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.180905Z"},"links":{"cited_paper":"/paper/2102.00815","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:7c031ebafb65e571af0cf0f36d10b53547992090a977edd5a9b65000e4f1fce6","observation_id":"10c998ed-53b6-4904-8ad3-5c7c84b0ce88","resolution":{"observed_at":"2026-08-04T10:03:30.180905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01349","last_updated":"2024-11-02T19:33:28Z","snapshot_observed_at":"2026-07-06T19:44:08.106986Z","submitted_at":"2024-11-02T19:33:28Z","title":"The Role of Domain Randomization in Training Diffusion Policies for Whole-Body Humanoid Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01349","snapshot_observed_at":"2026-08-04T10:03:30.308293Z","title":"The role of domain randomization in training diffusion policies for whole-body humanoid control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.308293Z"},"links":{"cited_paper":"/paper/2411.01349","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:21a2cadf09d92e38ed07293dbaa83dd6818b015eb5b527232dc41920fbd4a440","observation_id":"08439231-3013-4d01-9fd5-9dd36269bf6b","resolution":{"observed_at":"2026-08-04T10:03:30.308293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-04T10:03:30.394974Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.394974Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:ce4c137699645025f31c7fc073c40d075d8e5a632bb4abd3a7674ca565ae8aa1","observation_id":"74fc8085-0de7-424d-8198-0aedeeb842ca","resolution":{"observed_at":"2026-08-04T10:03:30.394974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:30.428840Z","title":"Actor-critic algorithms","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.428840Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:f469b74dae7791924c176e683daa9fc40afa6f144cb62f29dcd2ddc3cbd9a09c","observation_id":"ecfe473e-fcf0-4964-8b31-caf6109d252e","resolution":{"observed_at":"2026-08-04T10:03:30.428840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:30.508818Z","title":"Learning quadrupedal locomotion over challenging terrain","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.508818Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:0c9ff8d683486cab129ebf4b13ef2fe7bd53e667a6b3ca5e8f66767756285885","observation_id":"8f01d23c-e5f1-4e4e-b97b-61dd58461855","resolution":{"observed_at":"2026-08-04T10:03:30.508818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:30.562093Z","title":"Learning to Walk from Three Minutes of Real - World Data with Semi -structured Dynamics Models , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.562093Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:a8c534d19055512068f40c153318f2dd4e53f25964ff36ef7358ca2d3de275c7","observation_id":"afc4d0f2-b871-4947-b693-7132bc5c1050","resolution":{"observed_at":"2026-08-04T10:03:30.562093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:30.635467Z","title":"A Survey : Learning Embodied Intelligence from Physical Simulators and World Models , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.635467Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:f457632029b9ea5d02743d0a5cc7830e73048ba35acbc5914e5de6a1391eb5fc","observation_id":"4a4d8fb1-e292-4dc3-925e-709f08923fa9","resolution":{"observed_at":"2026-08-04T10:03:30.635467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:30.714843Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.714843Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:cc84e27c45c0ba42f6a80486fcff6411bf78ce806ce63e0d29cfa9016a329279","observation_id":"af29eafa-30a8-482a-a7a8-4fa71a91ed1b","resolution":{"observed_at":"2026-08-04T10:03:30.714843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/02783649231169492","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Combining physics and deep learning to learn continuous-time dynamics models","venue":"The International Journal of Robotics Research","work_id":"b56b6f5f-f07f-408f-9c00-78a28121f69a","year":2023},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.778393Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:4efba20f0b03ee1fbce3c58515645885ce007aa995c73d16e8fa85876bcfe968","observation_id":"4fdc2f0b-89a6-46b4-bf0c-d451a8c7dd29","resolution":{"observed_at":"2026-08-04T10:08:39.069158Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-04T10:03:30.827491Z","title":"Umap: Uniform manifold approximation and projection for dimension reduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.827491Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:cfaa8203c03cb3f0f6c3c042a8e5c6788e3b57765d72f72f10994157d15f3017","observation_id":"3b3c0a4f-6c29-4485-a882-771da65cbd07","resolution":{"observed_at":"2026-08-04T10:03:30.827491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08117","last_updated":"2022-01-20T11:27:47Z","snapshot_observed_at":"2026-08-05T08:18:40.786730Z","submitted_at":"2022-01-20T11:27:47Z","title":"Learning robust perceptive locomotion for quadrupedal robots in the wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08117","snapshot_observed_at":"2026-08-04T10:03:30.921104Z","title":"Learning robust perceptive locomotion for quadrupedal robots in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.921104Z"},"links":{"cited_paper":"/paper/2201.08117","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:d30cb376c782a4f1e31a0146be7e0334d6541dfcfb23861446d89e19a7414dce","observation_id":"51032244-5508-49df-a6f8-c77b79d71d82","resolution":{"observed_at":"2026-08-04T10:03:30.921104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:30.967138Z","title":"Orbit: A unified simulation framework for interactive robot learning environments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:30.967138Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:ca8859257d91b5e8cbe4b9fd0d1543aae630ca3b2ab486b49630aa7aa9ba2c77","observation_id":"5f1577d2-c062-4549-b5ca-1eb502819c71","resolution":{"observed_at":"2026-08-04T10:03:30.967138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:31.029123Z","title":"Symmetry considerations for learning task symmetric robot policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:31.029123Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:e28879d21510a58f5ad9f05f4fb5e778849db43ca4b39f4f8c53f5f0e0b74a08","observation_id":"9d1ddd80-807e-42f9-8996-cee712795bd9","resolution":{"observed_at":"2026-08-04T10:03:31.029123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:31.051659Z","title":"Murphy, Benjamin J","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:31.051659Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:6a5db0ee8e81c062bd57cfb2e5759dd6a8ed266d5f453a730242c3a1f047304a","observation_id":"3b8908e4-05e2-4906-b8bb-6f0a35fb9460","resolution":{"observed_at":"2026-08-04T10:03:31.051659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07544","last_updated":"2019-03-25T01:10:25Z","snapshot_observed_at":"2026-07-06T07:22:01.824536Z","submitted_at":"2018-12-18T18:20:49Z","title":"Information-Directed Exploration for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.07544","snapshot_observed_at":"2026-08-04T10:03:31.128989Z","title":"Information-directed exploration for deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:31.128989Z"},"links":{"cited_paper":"/paper/1812.07544","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:b5ca174bd47de0278ca2098a1125159d069e19d420a9267f4e37ef06e81ddba8","observation_id":"e64f4e7d-64d3-46be-9ee8-a7e3687320a1","resolution":{"observed_at":"2026-08-04T10:03:31.128989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02180","last_updated":"2022-05-12T04:38:30Z","snapshot_observed_at":"2026-08-03T18:40:17.998549Z","submitted_at":"2021-04-05T22:43:14Z","title":"AMP: Adversarial Motion Priors for Stylized Physics-Based Character Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02180","snapshot_observed_at":"2026-08-04T10:03:31.288541Z","title":"AMP : Adversarial Motion Priors for Stylized Physics - Based Character Control","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:31.288541Z"},"links":{"cited_paper":"/paper/2104.02180","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:eea5149ad33507239c4b3eeadebd56f060bb52161e7d4da1f78a14811a995e24","observation_id":"ef271075-0b1c-45af-9c5d-b0198420bb88","resolution":{"observed_at":"2026-08-04T10:03:31.288541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:31.431057Z","title":"ASE : large-scale reusable adversarial skill embeddings for physically simulated characters","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:31.431057Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:466f42ef39827b041a8c862af176178e6dbf59767f8dfafaa462598f64eecf4b","observation_id":"064f7195-f83e-4fd7-baea-b83735b3e5ca","resolution":{"observed_at":"2026-08-04T10:03:31.431057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:31.553721Z","title":"Whole-body end-effector pose tracking, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:31.553721Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:4132fa57d152ffa5cac6708f171d18a15f9ba02dfe569432f7a4be670261ec90","observation_id":"7746778e-0817-4026-9edc-9cf8c71397ca","resolution":{"observed_at":"2026-08-04T10:03:31.553721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:31.707213Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:31.707213Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:1db32beecdd9b3cd799c366b9f8c15afb538e7c2bb70edb8a57ee935857ca484","observation_id":"ccd69885-dcd6-4e78-bd2f-9fc122b88fd0","resolution":{"observed_at":"2026-08-04T10:03:31.707213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:31.866986Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:31.866986Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:df191790da5155f9202cccc0356a47a31c631edfe105762644c6a11bcda3f899","observation_id":"6062ef33-4f90-4afc-9db4-82b0d4a3a133","resolution":{"observed_at":"2026-08-04T10:03:31.866986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:31.980649Z","title":"Parkour in the Wild : Learning a General and Extensible Agile Locomotion Policy Using Multi -expert Distillation and RL Fine -tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:31.980649Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:51936f98c94eea9cd5467d9f5871b13a5d9fbd7161711df7a8a53107491c7add","observation_id":"808ac16b-76dd-43dc-9d59-e05db3c19195","resolution":{"observed_at":"2026-08-04T10:03:31.980649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T10:03:32.155903Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.155903Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:79e1463574b38a7d9c37cdb226f5098a07f2cecdc05be45ab087ff403b8b539b","observation_id":"df215aec-7d86-4320-884b-0e5eb467c7ef","resolution":{"observed_at":"2026-08-04T10:03:32.155903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10771","last_updated":"2025-09-13T01:31:43Z","snapshot_observed_at":"2026-08-08T00:00:46.147149Z","submitted_at":"2025-09-13T01:31:43Z","title":"RSL-RL: A Learning Library for Robotics Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10771","snapshot_observed_at":"2026-08-04T10:03:32.299059Z","title":"Rsl-rl: A learning library for robotics research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.299059Z"},"links":{"cited_paper":"/paper/2509.10771","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:9649a78c7bbe2e498e54d2392c5cdd2f0758e2a92f4c97a2de7a77bc297f8b13","observation_id":"22d664b8-f072-4b50-acea-3046f2fa3812","resolution":{"observed_at":"2026-08-04T10:03:32.299059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:32.469853Z","title":"Devon Hjelm, Philip Bachman, and Aaron C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.469853Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:bbd620183f5863298a0edbf2bacadf0cdbdf4ea69b9e8ba8328e5d7f425fe223","observation_id":"d75942fd-dba1-42da-890a-104e6d089818","resolution":{"observed_at":"2026-08-04T10:03:32.469853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:32.560939Z","title":"Planning to explore via self-supervised world models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.560939Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:c37163128f998d538110ec6d5febb3e69371e37c185985ba9ac12eccc73518c7","observation_id":"635783d2-0bd9-4137-9b8e-e962ae853a9d","resolution":{"observed_at":"2026-08-04T10:03:32.560939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08328","last_updated":"2021-05-18T07:49:15Z","snapshot_observed_at":"2026-08-08T07:19:42.138821Z","submitted_at":"2021-05-18T07:49:15Z","title":"Blind Bipedal Stair Traversal via Sim-to-Real Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08328","snapshot_observed_at":"2026-08-04T10:03:32.644933Z","title":"Blind bipedal stair traversal via sim-to-real reinforcement learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.644933Z"},"links":{"cited_paper":"/paper/2105.08328","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:e94c858d271fce2b9d583c4f49631ce55c95843ff63c0666a94df8a33e85e73e","observation_id":"dd9f9ead-8bea-47ce-bb5c-4210fca988c7","resolution":{"observed_at":"2026-08-04T10:03:32.644933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00946","last_updated":"2021-03-01T12:19:51Z","snapshot_observed_at":"2026-08-04T19:28:54.639052Z","submitted_at":"2021-03-01T12:19:51Z","title":"A Unified MPC Framework for Whole-Body Dynamic Locomotion and Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00946","snapshot_observed_at":"2026-08-04T10:03:32.760620Z","title":"A unified mpc framework for whole-body dynamic locomotion and manipulation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.760620Z"},"links":{"cited_paper":"/paper/2103.00946","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:410ac4e98f94a73dc821f9dd483da022d5273f5932b2c0a45801506cfa10f533","observation_id":"0c2add18-d72e-4490-8f31-36d43eb586a7","resolution":{"observed_at":"2026-08-04T10:03:32.760620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:32.828377Z","title":"Guided Reinforcement Learning for Robust Multi - Contact Loco - Manipulation , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.828377Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:4adecf5bdd45d7d17397649a34420509b14f4a675511d76dbd155d5b12125757","observation_id":"556918e7-efe7-47be-b5b0-a76e796d2ce2","resolution":{"observed_at":"2026-08-04T10:03:32.828377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:32.859664Z","title":"Perceptive Pedipulation with Local Obstacle Avoidance , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.859664Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:3bfc1a8b4250dcb0e348a6dd29fb31db5c054615355b728cfeab36c8171014e1","observation_id":"b55a044d-5d02-447e-9d50-e8e07a1bb76e","resolution":{"observed_at":"2026-08-04T10:03:32.859664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-10T15:50:18.915523Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-04T10:03:32.943196Z","title":"Gemini robotics: Bringing ai into the physical world","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.943196Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:bad2d444fc781e5f24b7c9ef5f5abd66b4e24671804fdf01fa7b5bc3fd1a4046","observation_id":"16b6cdf5-1ab6-4da4-9f48-d6a3ca6eddea","resolution":{"observed_at":"2026-08-04T10:03:32.943196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-04T10:03:32.996524Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:32.996524Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:c8dc34e6cc946099279fb0aa09836503c896b52e3cbb316fc6be3a4d589cb5d8","observation_id":"729cd458-865d-47fd-8b9e-db05840368d5","resolution":{"observed_at":"2026-08-04T10:03:32.996524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T10:03:33.116502Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:33.116502Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:600109372fac63829c9ea2c192b8d420fc0f2bc7107c40e2da9cb1684e858b4c","observation_id":"7c9ac8a9-0987-4798-ba2b-c9eea7696d2b","resolution":{"observed_at":"2026-08-04T10:03:33.116502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14912","last_updated":"2022-03-23T09:24:06Z","snapshot_observed_at":"2026-07-06T12:53:46.595393Z","submitted_at":"2022-03-23T09:24:06Z","title":"Advanced Skills through Multiple Adversarial Motion Priors in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14912","snapshot_observed_at":"2026-08-04T10:03:33.186830Z","title":"Advanced skills through multiple adversarial motion priors in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:33.186830Z"},"links":{"cited_paper":"/paper/2203.14912","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:cc677913ee7f6059098d9bd5296ce67dc56e41782fe1fbb7e1b379a0901a053f","observation_id":"67680e13-674a-45b2-8344-3c1051849caf","resolution":{"observed_at":"2026-08-04T10:03:33.186830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:33.336742Z","title":"Pretraining in Deep Reinforcement Learning : A Survey , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:33.336742Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:0cdc865f98f98053d1f69a0e5eb14434569dac5922d53a604f16043b59d76a00","observation_id":"09a85d7d-c0f3-4016-8ec8-9ef83cfdd9a4","resolution":{"observed_at":"2026-08-04T10:03:33.336742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15755","last_updated":"2025-08-21T17:54:41Z","snapshot_observed_at":"2026-08-09T20:50:36.303587Z","submitted_at":"2025-08-21T17:54:41Z","title":"Neural Robot Dynamics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15755","snapshot_observed_at":"2026-08-04T10:03:33.453741Z","title":"Neural robot dynamics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:33.453741Z"},"links":{"cited_paper":"/paper/2508.15755","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:d967b4d99dba497c34655e3d9a31ed2c90cbd9f2f38ac0c3c3c533b74276285a","observation_id":"2cadf785-2002-4825-9e71-e5fb6d831ca3","resolution":{"observed_at":"2026-08-04T10:03:33.453741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01201","last_updated":"2023-04-03T17:59:56Z","snapshot_observed_at":"2026-08-03T16:05:00.217688Z","submitted_at":"2023-04-03T17:59:56Z","title":"Neural Volumetric Memory for Visual Locomotion Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01201","snapshot_observed_at":"2026-08-04T10:03:33.537036Z","title":"Neural volumetric memory for visual locomotion control, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:33.537036Z"},"links":{"cited_paper":"/paper/2304.01201","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:c5c359c267e14031e0a08c77caef83faadd325a9e0f90acd7cba595900a3e163","observation_id":"0720e17b-93fc-47e2-baf5-2e48e902188f","resolution":{"observed_at":"2026-08-04T10:03:33.537036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08299","last_updated":"2025-03-11T11:10:33Z","snapshot_observed_at":"2026-08-07T17:13:24.890536Z","submitted_at":"2025-03-11T11:10:33Z","title":"Distillation-PPO: A Novel Two-Stage Reinforcement Learning Framework for Humanoid Robot Perceptive Locomotion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08299","snapshot_observed_at":"2026-08-04T10:03:33.681668Z","title":"Distillation-ppo: A novel two-stage reinforcement learning framework for humanoid robot perceptive locomotion, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:33.681668Z"},"links":{"cited_paper":"/paper/2503.08299","citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:120b4181784fb77069d5a41179ad7c8d446f2e76edf8bb3082a17b0dd1c73da5","observation_id":"38f54183-f9cb-48f4-a584-dbf9ffd60c9a","resolution":{"observed_at":"2026-08-04T10:03:33.681668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:33.824504Z","title":"Intention- Conditioned Flow Occupancy Models , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:33.824504Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:1bb0dfaa9f09f61af37a80c91f94b363d7807e9dd0645f7187446635b44f99bf","observation_id":"9732485e-cbf4-4a40-8b4f-fd73d5922e81","resolution":{"observed_at":"2026-08-04T10:03:33.824504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:33.977983Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:33.977983Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:abad35d1ae3845e623137545dc3d528ceed66ee71293fd1eb3de2e2021faf260","observation_id":"671711d3-e693-4cf3-ab56-581b6eff25de","resolution":{"observed_at":"2026-08-04T10:03:33.977983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:34.095585Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:34.095585Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:cf67695aae01d6bdb6da97a8d3a1c9e4e3e1df710754be44d33a3bc2cd6164d6","observation_id":"f6fdb2e7-a1c5-4abf-af22-05565b03b945","resolution":{"observed_at":"2026-08-04T10:03:34.095585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:34.173302Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:34.173302Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:cfb94834d69828aa535491d9750539e235f34eb7be8dfdc90925a9b0abba87cf","observation_id":"c2278c11-d25d-4377-bf2c-d4b6aae46917","resolution":{"observed_at":"2026-08-04T10:03:34.173302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:03:34.319088Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T10:03:34.319088Z"},"links":{"citing_paper":"/paper/2510.12363"},"observation_digest":"sha256:b8c8c4bd463833cb796f021c187a5ab96a954b5230a4d5f68401f0b26576475e","observation_id":"316195b7-0025-4aaf-ad1a-4d3106a29923","resolution":{"observed_at":"2026-08-04T10:03:34.319088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.12363","last_updated":"2026-07-15T13:48:12Z","latest_version":4,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T23:47:26.954223Z","submitted_at":"2025-10-14T10:25:40Z","title":"Pretraining in Actor-Critic Reinforcement Learning for Locomotion"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2510.12363."}