{"as_of":"2026-08-08T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12b1f9efac623a053ea70467f0083589f35dcae05f090d947a4e22ce122c6035","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:36:20.594100Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T00:54:12.099045Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:30:07.865484Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"cited_work":{"arxiv_id":"2602.20220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.20220","snapshot_observed_at":"2026-07-24T01:23:06.202989Z","title":"What matters for simulation to online reinforcement learning on real robots","venue":null,"work_id":"7d124099-da54-4384-870e-6bd563897eae","year":2026},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T05:33:19.038889Z"},"links":{"cited_paper":"/paper/2602.20220","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:7e0ae308212032f45ce9c5aac1286199828d8f107aa5069b8c6cb111ddb3bdce","observation_id":"50d12e37-728d-474c-9076-3b96a36dfde5","resolution":{"observed_at":"2026-07-24T01:23:06.202989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"cited_work":{"arxiv_id":"2602.20220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.20220","snapshot_observed_at":"2026-07-24T01:23:06.202989Z","title":"What matters for simulation to online reinforcement learning on real robots","venue":null,"work_id":"7d124099-da54-4384-870e-6bd563897eae","year":2026},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T06:27:38.643667Z"},"links":{"cited_paper":"/paper/2602.20220","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:542205b6dfb34dfd85063bb933e6a22384c8d0276f7a6bb2417988128c85a3c8","observation_id":"4164f62f-e63c-4b79-acf8-92dde9862f29","resolution":{"observed_at":"2026-07-24T01:23:06.202989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"cited_work":{"arxiv_id":"2602.20220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.20220","snapshot_observed_at":"2026-07-24T01:23:06.202989Z","title":"What matters for simulation to online reinforcement learning on real robots","venue":null,"work_id":"7d124099-da54-4384-870e-6bd563897eae","year":2026},"citing_paper":{"arxiv_id":"2605.10236","last_updated":"2026-05-17T21:09:20Z","snapshot_observed_at":"2026-08-06T08:24:06.705324Z","submitted_at":"2026-05-11T09:11:05Z","title":"When Does Non-Uniform Replay Matter in Reinforcement Learning?","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T23:04:12.943222Z"},"links":{"cited_paper":"/paper/2602.20220","citing_paper":"/paper/2605.10236"},"observation_digest":"sha256:1af9e8a30f6a68f131b5b45a9fffc6e64603b4ad36a0282efe840e1338c167d7","observation_id":"4f4131a2-19b8-4be1-b740-ba5a28bc8d2f","resolution":{"observed_at":"2026-07-24T01:23:06.202989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"cited_work":{"arxiv_id":"2602.20220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.20220","snapshot_observed_at":"2026-07-24T01:23:06.202989Z","title":"What matters for simulation to online reinforcement learning on real robots","venue":null,"work_id":"7d124099-da54-4384-870e-6bd563897eae","year":2026},"citing_paper":{"arxiv_id":"2605.24975","last_updated":"2026-05-24T10:04:11Z","snapshot_observed_at":"2026-08-08T13:46:54.260741Z","submitted_at":"2026-05-24T10:04:11Z","title":"Bridging the Gap: Enabling Soft Actor Critic for High Performance Legged Locomotion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T00:54:12.099045Z"},"links":{"cited_paper":"/paper/2602.20220","citing_paper":"/paper/2605.24975"},"observation_digest":"sha256:68a1f7e0094a5f4a1a844b117d742994a9988bcd6da28eb379245323c16df2c3","observation_id":"c5dd250e-99a1-4000-9ec4-69b9c9d8cff6","resolution":{"observed_at":"2026-07-24T01:23:06.202989Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"cited_work":{"arxiv_id":"2602.20220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.20220","snapshot_observed_at":"2026-07-24T01:23:06.202989Z","title":"What matters for simulation to online reinforcement learning on real robots","venue":null,"work_id":"7d124099-da54-4384-870e-6bd563897eae","year":2026},"citing_paper":{"arxiv_id":"2606.25527","last_updated":"2026-06-24T08:05:28Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T08:05:28Z","title":"Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T21:15:07.735336Z"},"links":{"cited_paper":"/paper/2602.20220","citing_paper":"/paper/2606.25527"},"observation_digest":"sha256:bcc36ad56bc48a4f1a97256db3b4dd76ecb97bcb67a51c0b43154dacac3f0468","observation_id":"a8e4ee06-e705-480f-8093-511a101ddd32","resolution":{"observed_at":"2026-07-24T01:23:06.202989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.20220/citation-record","integrity":"/paper/2602.20220/integrity","json":"/paper/2602.20220/citation-record.json","paper":"/paper/2602.20220"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:14.774918Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:14.774918Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:db2441e1674e1f86b7d8e1df18e3c72a34d96beed157e647d89cdccd26ada58d","observation_id":"d0f41b2c-084d-4af3-abd4-5bde4a65733e","resolution":{"observed_at":"2026-08-02T21:36:14.774918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:14.912650Z","title":"Chapman & Hall/CRC Artificial Intelligence and Robotics Series","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:14.912650Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:36d5e4d0f2b94c96f103a47a05fdaa9cfd626a25fbf427ff9029085f806911c6","observation_id":"199c9738-505b-4318-b676-c2f9038dd93e","resolution":{"observed_at":"2026-08-02T21:36:14.912650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:15.038547Z","title":"Learning agile and dynamic motor skills for legged robots.Science Robotics, 2019.(Cited on pages 1, 4, and 16)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:15.038547Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:bed679b52631c62e0da3424e744ce985034fc965e57c5b4681ba0ee657b83531","observation_id":"ea16bc4e-da9f-45d8-94a4-48aa0f8cc747","resolution":{"observed_at":"2026-08-02T21:36:15.038547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17110","last_updated":"2023-05-26T17:20:02Z","snapshot_observed_at":"2026-08-04T05:11:06.869803Z","submitted_at":"2023-05-26T17:20:02Z","title":"IndustReal: Transferring Contact-Rich Assembly Tasks from Simulation to Reality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17110","snapshot_observed_at":"2026-08-02T21:36:15.185043Z","title":"Industreal: Transferring contact-rich assembly tasks from simulation to reality.arXiv preprint arXiv:2305.17110, 2023.(Cited on page 1)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:15.185043Z"},"links":{"cited_paper":"/paper/2305.17110","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:655edd5974cd69dcf0f10d383abd8e2d1a4b9b6bcf7bbc60dd9c0766ed558856","observation_id":"c4db4aa6-7aa6-472e-8232-0ea10948f984","resolution":{"observed_at":"2026-08-02T21:36:15.185043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:15.320459Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, 2025.(Cited on page 1)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:15.320459Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:de0435febf5eea3c36fb9656d832aaa75ddb528c69be8b337b372bfdc85ec576","observation_id":"5b539d2b-dbe1-4d68-b143-319871fdcb19","resolution":{"observed_at":"2026-08-02T21:36:15.320459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08241","last_updated":"2025-11-13T10:27:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-11T17:55:26Z","title":"BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08241","snapshot_observed_at":"2026-08-02T21:36:15.439847Z","title":"Beyondmimic: From motion tracking to versatile humanoid control via guided diffusion.arXiv preprint arXiv:2508.08241, 2025.(Cited on page 1)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:15.439847Z"},"links":{"cited_paper":"/paper/2508.08241","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:602b580f8a1988b433cb7152ce151fe7d1235ac76f4369384b7c61334adf7fcf","observation_id":"3b468079-d591-46a5-b6b9-a3df30d7e2e5","resolution":{"observed_at":"2026-08-02T21:36:15.439847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:15.538983Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:15.538983Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:0d5ed659c7709673cbd91a28bc085a3a688bbde04ab1c1b9f6da584ba4d79fc0","observation_id":"a8bc4987-e5a0-4568-9286-8af018904a9e","resolution":{"observed_at":"2026-08-02T21:36:15.538983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:15.643230Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:15.643230Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:aa84059a0872a819e3d4f82be4ef9c4b6ebb66515dfd5bcd2d1f518204f1cb68","observation_id":"5045fc0f-ad30-4576-9aa4-c0617cf410e8","resolution":{"observed_at":"2026-08-02T21:36:15.643230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08844","last_updated":"2025-02-12T23:30:01Z","snapshot_observed_at":"2026-08-07T23:27:22.713894Z","submitted_at":"2025-02-12T23:30:01Z","title":"MuJoCo Playground","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08844","snapshot_observed_at":"2026-08-02T21:36:15.812654Z","title":"Mujoco playground.arXiv preprint arXiv:2502.08844, 2025.(Cited on pages 1, 4, 7, 8, 16, 18, and 19)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:15.812654Z"},"links":{"cited_paper":"/paper/2502.08844","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:7ea81bf35435a4b1e2743fb0a007f5f94d3bd351b7328e18bec57ec10a9fde89","observation_id":"e0fe0836-7a91-45e0-b36e-41a57adab712","resolution":{"observed_at":"2026-08-02T21:36:15.812654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:15.940499Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:15.940499Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:9338ab87e104211969d2d46e159452757bccb52423af9de29e1d92c583de0b0a","observation_id":"18d1731a-ce5b-4d04-be6f-fa854c6de330","resolution":{"observed_at":"2026-08-02T21:36:15.940499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:16.060341Z","title":"Reinforcement learning in robotics: A survey.The International Journal of Robotics Research, 2013.(Cited on page 2)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.060341Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:677afff396e1fd2de2d5904f1c38b5eab38d84f27a86f26f4cb30626de66df7f","observation_id":"2c5b7039-aa41-41da-8867-96c6d4ea6998","resolution":{"observed_at":"2026-08-02T21:36:16.060341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08550","last_updated":"2020-11-03T05:46:51Z","snapshot_observed_at":"2026-08-07T08:54:28.901497Z","submitted_at":"2020-02-20T03:36:39Z","title":"Learning to Walk in the Real World with Minimal Human Effort","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08550","snapshot_observed_at":"2026-08-02T21:36:16.146523Z","title":"Learning to walk in the real world with minimal human effort.arXiv preprint arXiv:2002.08550, 2020.(Cited on page 2)","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.146523Z"},"links":{"cited_paper":"/paper/2002.08550","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:9da03b7bde9c0d5cae0c9bbb523b1eb66c3f36d100012152dddfae87b078db85","observation_id":"e992df3b-93cf-4d08-bb18-e23315fe83f2","resolution":{"observed_at":"2026-08-02T21:36:16.146523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14500","last_updated":"2020-10-27T17:57:29Z","snapshot_observed_at":"2026-07-06T10:09:06.864468Z","submitted_at":"2020-10-27T17:57:29Z","title":"COG: Connecting New Skills to Past Experience with Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14500","snapshot_observed_at":"2026-08-02T21:36:16.288114Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.288114Z"},"links":{"cited_paper":"/paper/2010.14500","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:dc2f4de093b05d1475fbf17e7ead285b1b7639dd40ee3696f148638ceeb4e2ea","observation_id":"35b970f1-1a5d-4fb4-8434-4fb20438dc4d","resolution":{"observed_at":"2026-08-02T21:36:16.288114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-02T21:36:16.362061Z","title":"Awac: Accelerating online reinforcement learning with offline datasets.arXiv preprint arXiv:2006.09359, 2020.(Cited on pages 2 and 5)","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.362061Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:84306188028e78dc92c10ae90b04f7a56746fc23aa72b063eda6b06e3bf6effd","observation_id":"e663363f-be65-4594-be85-639a72cf995d","resolution":{"observed_at":"2026-08-02T21:36:16.362061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:16.427429Z","title":"Daydreamer: World models for physical robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.427429Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:ee0867f1d67bee275fb71999caaf5b6a7e78bea5334abcf477e1518a56789b06","observation_id":"49603da0-a967-47cc-b000-7cf3056edd41","resolution":{"observed_at":"2026-08-02T21:36:16.427429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:16.486641Z","title":"Finetuning offline world models in the real world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.486641Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:ecdf38ac3f63f0ec424b0d32048500ff4614cf753e4dcebbd6ede253b4c2c204","observation_id":"49bdb634-e974-4521-9030-eea7149544a2","resolution":{"observed_at":"2026-08-02T21:36:16.486641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:16.569698Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.569698Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:f85e84e173e99771a4c7bae6a700847d16c89374c2e19c02554e89ec429ac025","observation_id":"0afc3af8-ccc3-437b-9367-d565cf119dc2","resolution":{"observed_at":"2026-08-02T21:36:16.569698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:16.655141Z","title":"Precise and dexterous robotic manipulation via human-in-the-loop reinforcement learning.Science Robotics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.655141Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:7a8c570563eead51254dff76310bd47796d3f787f484b09422bad1ebddee415b","observation_id":"4a5941a7-1329-4d9c-825f-63ffa8271895","resolution":{"observed_at":"2026-08-02T21:36:16.655141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:16.710341Z","title":"How to train your robot with deep reinforcement learning: lessons we have learned","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.710341Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:a9e7fa100e9eb147742f953c264f2903edbb8c9019851838d8874c44d2f15e5f","observation_id":"aeb0df54-3849-4454-b1d4-7b27d093f396","resolution":{"observed_at":"2026-08-02T21:36:16.710341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:16.769044Z","title":"Replay across experiments: A natural extension of off-policy RL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.769044Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:de4e9ab7172ca8f720197d244785c8b6f62e00054570b3e6fc701f62bf6e4a28","observation_id":"35779e2c-c688-4e04-a37c-181e12850100","resolution":{"observed_at":"2026-08-02T21:36:16.769044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:16.822116Z","title":"Rapidly adapting policies to the real-world via simulation- guided fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.822116Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:2d674d31510ec6445ea5030a8c0e24dec1c3c9ee6ca497bc95e946815386b5e5","observation_id":"fcb15989-78d9-47cc-8d20-4a9197518654","resolution":{"observed_at":"2026-08-02T21:36:16.822116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:16.872595Z","title":"Legged robots that keep on learning: Fine-tuning locomotion policies in the real world","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.872595Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:601189ee6da12f9ec7f76ad0421a4fb5af592e2da78b6e9a1d87f14861a22169","observation_id":"eae6870c-b5d4-46d7-9f59-7c5d484b0d63","resolution":{"observed_at":"2026-08-02T21:36:16.872595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07860","last_updated":"2022-08-16T17:37:36Z","snapshot_observed_at":"2026-08-07T07:51:14.255787Z","submitted_at":"2022-08-16T17:37:36Z","title":"A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07860","snapshot_observed_at":"2026-08-02T21:36:16.982549Z","title":"A walk in the park: Learning to walk in 20 minutes with model-free reinforcement learning.arXiv preprint arXiv:2208.07860, 2022.(Cited on pages 3 and 21)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:16.982549Z"},"links":{"cited_paper":"/paper/2208.07860","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:5782b535f0f11fe5cdfd12cc9936bc4a0cdd6dd78337c9db8c99db163c53405d","observation_id":"ec06c701-36de-4cb1-b092-0e80c8cf97d6","resolution":{"observed_at":"2026-08-02T21:36:16.982549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.066546Z","title":"John Wiley & Sons, 2014.(Cited on page 3)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.066546Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:4bef6079b58dedf0ef0d73e5d39a28c30bf20af051dbdb525421c6aeaf69a9ca","observation_id":"8c8dacd8-67b1-44ed-a07e-b3560b586e1c","resolution":{"observed_at":"2026-08-02T21:36:17.066546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.149872Z","title":"Bertsekas.Dynamic Programming and Optimal Control","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.149872Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:a8b0d80319880e700cac717e85b425f329b6eab5a5357fc11c38ca33496c423d","observation_id":"d2ec8e4b-ec90-42e5-8169-8eeb7f2886a8","resolution":{"observed_at":"2026-08-02T21:36:17.149872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.212167Z","title":"Self-improving reactive agents based on reinforcement learning, planning and teaching.Machine Learning, 1992.(Cited on page 3)","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.212167Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:b796206ca714a3f14d4b75926399e190a3cb23fd1f49cfba5d068a23ca1719ab","observation_id":"95118829-be51-4362-8de9-a2b444fb34b8","resolution":{"observed_at":"2026-08-02T21:36:17.212167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-02T21:36:17.273492Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.273492Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:b990afbfe0d2bc48cfe46f3ddcb80783b023d40304163c7aac0c8140d87ee991","observation_id":"8a6cbda2-8f21-4002-a97d-9f3f62d7fdef","resolution":{"observed_at":"2026-08-02T21:36:17.273492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.343917Z","title":"Leave no trace: Learning to reset for safe and autonomous reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.343917Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:25e4114554eeba2914d68bc1d4079a4a0515e346998a0d7cd05b544b30923149","observation_id":"d9bbb50d-629c-4143-ad84-c34ed3a9a806","resolution":{"observed_at":"2026-08-02T21:36:17.343917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.434804Z","title":"Autonomous reinforcement learning via subgoal curricula","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.434804Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:9bcb00a0522d2361b659da096fb47e966595ba74ac834ba5b7c667d1026f7442","observation_id":"ae849b38-2b39-446c-952f-017029ec61da","resolution":{"observed_at":"2026-08-02T21:36:17.434804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.498275Z","title":"Autonomous reinforcement learning: Formalism and bench- marking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.498275Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:ad18fe3b8b3d3b7ca6edce1f81ade4ad92d8204e2ed4d09fd6eef13f5f2bdbd3","observation_id":"9ea8fff8-18b2-415e-b6f4-9aab26499aa2","resolution":{"observed_at":"2026-08-02T21:36:17.498275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.537624Z","title":"A state-distribution matching ap- proach to non-episodic reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.537624Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:3376d09d2bbc4a9d0a13cc33c8a7e9db5d00e68bddfb459be24344ed3e131664","observation_id":"5ef68a0d-8401-45e4-b983-2aca514542f6","resolution":{"observed_at":"2026-08-02T21:36:17.537624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.613572Z","title":"Conservative q-learning for offline reinforcement learning, 2020.(Cited on page 3)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.613572Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:e16671f9dafeaefae9db3787880f41cc476906c2c81e752cbf2a4df0c1f7f5c6","observation_id":"6543067f-033e-4fc1-bad9-9fa9fb4a43d1","resolution":{"observed_at":"2026-08-02T21:36:17.613572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.697358Z","title":"Mopo: Model-based offline policy optimization.Interna- tional Conference on Neural Information Processing Systems, 2020.(Cited on page 3)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.697358Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:677a8a77780f495ee39a69c86d8a1aa6defd832602878ac50f9f96bdb77adb4b","observation_id":"728fc3ef-3fa6-41dc-a5c6-8930da6f9094","resolution":{"observed_at":"2026-08-02T21:36:17.697358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.782001Z","title":"Offline robotic world model: Learning robotic policies without a physics simulator.arXiv preprint arXiv:2504.16680, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.782001Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:3cc7758502d6a240cd4e66535a928254e84ce6a27a1656b85428638a13c21a37","observation_id":"e7485183-7f90-4f72-8341-4a8b32ff8772","resolution":{"observed_at":"2026-08-02T21:36:17.782001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04831","last_updated":"2025-11-06T21:43:02Z","snapshot_observed_at":"2026-08-07T13:59:26.312342Z","submitted_at":"2025-11-06T21:43:02Z","title":"Isaac Lab: A GPU-Accelerated Simulation Framework for Multi-Modal Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04831","snapshot_observed_at":"2026-08-02T21:36:17.872048Z","title":"Isaac lab: A gpu-accelerated simulation framework for multi-modal robot learning.arXiv preprint arXiv:2511.04831, 2025.(Cited on page 4)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.872048Z"},"links":{"cited_paper":"/paper/2511.04831","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:28e115814d50bbbcaae37167a1bf82c5e6bf2d185e9eff1126288f250b43f3b6","observation_id":"5bdaafc0-11e2-4038-b166-0913b520896b","resolution":{"observed_at":"2026-08-02T21:36:17.872048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:17.936062Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world, 2017.(Cited on page 4)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:17.936062Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:485ad8719e206444b43e8e7e8a660ab82263f277ca2e8719a5b07ac7369dd121","observation_id":"2b4a616a-9301-4e32-a7e2-17f787cf13d0","resolution":{"observed_at":"2026-08-02T21:36:17.936062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T21:36:18.048453Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017.(Cited on page 4)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.048453Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:1b408eeb0377890998e5c4abc6701ace1bd63f397f74a980946a2b1bfcf9f86b","observation_id":"09b1d3c5-c5b2-487b-abda-34881eb05015","resolution":{"observed_at":"2026-08-02T21:36:18.048453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-02T21:36:18.148009Z","title":"Continuous control with deep reinforcement learning.arXiv preprint arXiv:1509.02971, 2015.(Cited on pages 4 and 5)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.148009Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:4a712f032f203d22397bb360f1456fc2e447f7383d29dbe0b60dfb173840f015","observation_id":"a7f03011-c7d5-40d4-8012-4ae88726a5be","resolution":{"observed_at":"2026-08-02T21:36:18.148009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-07-06T06:45:27.162265Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-08-02T21:36:18.267758Z","title":"Maximum a posteriori policy optimisation.arXiv preprint arXiv:1806.06920, 2018.(Cited on page 4)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.267758Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:c6eb0c516c7a718222a7cc645779ffc599d53d96ea8d88a9191f0b5e8f0413a0","observation_id":"12607e4a-8e25-4eb0-b54c-f04c69513eaa","resolution":{"observed_at":"2026-08-02T21:36:18.267758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-02T21:36:18.389537Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.arXiv preprint arXiv:1910.00177, 2019.(Cited on page 4)","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.389537Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:fe0431eb05dc5d83039f6b4750ed7ae4771f61434476e5f5962e611c2433dc90","observation_id":"ec0e7c28-e502-4ccc-b5c7-65ea28f899d9","resolution":{"observed_at":"2026-08-02T21:36:18.389537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:18.524919Z","title":"Getting sac to work on a massive parallel simulator: An rl journey with off-policy algorithms.araffin.github.io, Feb 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.524919Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:daf234d060fe2c07dad252683ac278786b539d63d98219609774aa01b7fdce94","observation_id":"8b9944c4-d5cd-40ba-b0da-54d8bf9e1c1b","resolution":{"observed_at":"2026-08-02T21:36:18.524919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:18.649530Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.649530Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:714a0390a3bf179523bc7249a6238e74b358e5c6dc174fa57a2aa1b711b3aa05","observation_id":"f91f8002-d474-4132-b42d-28742e810476","resolution":{"observed_at":"2026-08-02T21:36:18.649530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06440","last_updated":"2018-10-14T22:54:38Z","snapshot_observed_at":"2026-08-05T07:10:19.910840Z","submitted_at":"2017-04-21T08:33:59Z","title":"Equivalence Between Policy Gradients and Soft Q-Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06440","snapshot_observed_at":"2026-08-02T21:36:18.708908Z","title":"Equivalence between policy gradients and soft q-learning.arXiv preprint arXiv:1704.06440, 2017.(Cited on page 4)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.708908Z"},"links":{"cited_paper":"/paper/1704.06440","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:5e8a1ab4a27bc0b6030fdd441ac95750a31b0d7ff19e8744d9ac0c46abb9d584","observation_id":"e38426cc-261d-4af9-a24b-a1b26f067720","resolution":{"observed_at":"2026-08-02T21:36:18.708908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:18.776319Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.776319Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:8a512c6986c35ffc91e79a4ad8bf44613d725707d0fb464b53a4bc37ec0cddf8","observation_id":"f8038379-071f-4908-8ce9-0964fd7587bb","resolution":{"observed_at":"2026-08-02T21:36:18.776319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:18.847505Z","title":"Efficient online reinforce- ment learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.847505Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:93e3618dbd360c744eba682824ec472297a55c17899e4452172d789e6915f9d2","observation_id":"99aa29d9-ae53-43fa-a639-6ff2d9fda713","resolution":{"observed_at":"2026-08-02T21:36:18.847505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:18.979143Z","title":"Hybrid RL: Using both offline and online data can make RL efficient","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:18.979143Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:950ee45aa70599714c57ba07648850b4f6bc79cffcf9105acba3cb978a827ae0","observation_id":"0046c12a-d261-42b2-8c9d-f213ce832d7c","resolution":{"observed_at":"2026-08-02T21:36:18.979143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:19.076082Z","title":"Steering your generalists: Improving robotic foundation models via value guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.076082Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:6bf8c61d396fb83d8d7fa1ae34ac830d746739fd6df7ce7323f40430010763ad","observation_id":"e3c04ac4-a1e0-4474-bb0e-76dad9d3473f","resolution":{"observed_at":"2026-08-02T21:36:19.076082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-02T21:36:19.144684Z","title":"Offline reinforce- ment learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020.(Cited on page 5)","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.144684Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:ed5898b7e5fab579df159c00ffcbb79ff800c4b0a243b2e82b7a2449651e9f40","observation_id":"2755953c-b859-48c9-a2d3-eb29f534a7b7","resolution":{"observed_at":"2026-08-02T21:36:19.144684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:19.267132Z","title":"When to trust your model: Model-based policy optimization.Advances in Neural Information Processing Systems, 2019.(Cited on page 6)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.267132Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:eb517b4b3193c42fe3b50ca9cb40a03eebe22675412bafb635c0be0fe0244665","observation_id":"17a6ed49-e9d1-4538-9dd9-4301de990671","resolution":{"observed_at":"2026-08-02T21:36:19.267132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-02T21:36:19.350061Z","title":"Randomized ensembled double q-learning: Learning fast without a model.arXiv preprint arXiv:2101.05982, 2021.(Cited on page 6)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.350061Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:5da969ae7b95a004454526ae862e6754baa7e75442673834124dff0d5d506d67","observation_id":"98f63cc1-5242-4820-86e2-1075fe6e3200","resolution":{"observed_at":"2026-08-02T21:36:19.350061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:19.444034Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.444034Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:d3a7975f32cdf1c356dea93563cc12be028ca52e4ed7b74b98c9de7c5d1f7866","observation_id":"0883ae8d-da4f-4058-987b-f6103e43e0ee","resolution":{"observed_at":"2026-08-02T21:36:19.444034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:19.522344Z","title":"On actor-critic algorithms.SIAM journal on Control and Optimization, 2003.(Cited on page 6)","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.522344Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:f5f6262d7f46df0a3a58a503d5236d36c37b4f4534259680aa2c32ace28937f9","observation_id":"ae73a42f-fc73-455f-8f40-635d2680f5a4","resolution":{"observed_at":"2026-08-02T21:36:19.522344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:19.606910Z","title":"Convergence rate of linear two-time-scale stochastic approximation","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.606910Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:3f2bfdb9a50259c529a41a41ab99368758bad8c92eb44ccc7867d3996492e3db","observation_id":"f97fd0ea-306a-40e3-b65a-d84a07841582","resolution":{"observed_at":"2026-08-02T21:36:19.606910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:19.714180Z","title":"Springer.(Cited on page 6)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.714180Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:ceb8efc2f0780481356b687c4a72d6695d7d6d18605eab12bf0d654648b1976d","observation_id":"8803372a-5837-4c18-81e8-79baf7ef0c02","resolution":{"observed_at":"2026-08-02T21:36:19.714180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:19.793441Z","title":"Amz driverless: The full autonomous racing system.Journal of Field Robotics, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.793441Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:72dc9433c0342412fff6de175b7af7b1fdfea08d63febe2c573297eacafdfb3d","observation_id":"694a49a7-0eed-41b5-b595-255e0af53ddb","resolution":{"observed_at":"2026-08-02T21:36:19.793441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:19.884990Z","title":"Bigger, regularized, optimistic: scaling for compute and sample efficient continuous control.Advances in neural information processing systems, 2024.(Cited on page 6)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.884990Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:f4daa07d731cfcd97efc50532354c5cb90a8d740eb1c36bb5c68a191b86cf5db","observation_id":"b18bc99e-e26c-4b4f-afcb-bc9e5ec90bd2","resolution":{"observed_at":"2026-08-02T21:36:19.884990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09645","last_updated":"2021-07-20T17:29:13Z","snapshot_observed_at":"2026-07-06T11:30:56.150751Z","submitted_at":"2021-07-20T17:29:13Z","title":"Mastering Visual Continuous Control: Improved Data-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09645","snapshot_observed_at":"2026-08-02T21:36:19.987578Z","title":"Mastering visual continuous control: Improved data-augmented reinforcement learning.arXiv preprint arXiv:2107.09645, 2021.(Cited on page 6)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:19.987578Z"},"links":{"cited_paper":"/paper/2107.09645","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:584c522034c095d8a0c25443366358bc6e9a0ec8fb73174980981344a363b037","observation_id":"80659e87-a4d6-4f0c-8f44-c83961372503","resolution":{"observed_at":"2026-08-02T21:36:19.987578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:20.045335Z","title":"Daniel Freeman, Erik Frey, Anton Raichuk, Sertan Girgin, Igor Mordatch, and Olivier Bachem","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:20.045335Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:167d83a5b8f5ee7ec5885b75d8a7f727131277300cca7b3168301016bdeec3f5","observation_id":"a6637cae-b873-4075-88ed-f1a08803f236","resolution":{"observed_at":"2026-08-02T21:36:20.045335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:20.218776Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:20.218776Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:cad03d1df2ffaf72c5a6901fdc237274a70cc94b3ea01c703f8ae5ef30ed70fe","observation_id":"e7321c3d-81bd-4178-9007-74804c64cf8d","resolution":{"observed_at":"2026-08-02T21:36:20.218776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:20.299420Z","title":"Parallel𝑞- learning: Scaling off-policy reinforcement learning under massively parallel simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:20.299420Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:25aa017eae8cae42a6f26d957284cfb9032410d56b70517e50953efae6e52eea","observation_id":"9afc4bba-b672-4573-97ea-b3b0ba22dc8a","resolution":{"observed_at":"2026-08-02T21:36:20.299420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22642","last_updated":"2025-06-01T22:51:56Z","snapshot_observed_at":"2026-08-07T13:00:11.313396Z","submitted_at":"2025-05-28T17:55:26Z","title":"FastTD3: Simple, Fast, and Capable Reinforcement Learning for Humanoid Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22642","snapshot_observed_at":"2026-08-02T21:36:20.383255Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:20.383255Z"},"links":{"cited_paper":"/paper/2505.22642","citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:290755fd95c4a6d48d05e21913b4d245c14c8b75a3727c7ec817b0af1bf937fc","observation_id":"9db694ae-f907-40ab-903c-7895f5901824","resolution":{"observed_at":"2026-08-02T21:36:20.383255Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:20.445601Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:20.445601Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:90bf959eca4a6c298fc351f63ae0ca9b8dbd26438e61e542a47f092cb7907e46","observation_id":"6999d73e-3b90-4573-9448-2d9827b80b98","resolution":{"observed_at":"2026-08-02T21:36:20.445601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:20.529448Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:20.529448Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:4204e9948cefc851577699a84de236904de3687e8fe9b62fbd10c5f8da983bdc","observation_id":"5446a11e-446e-4b75-a361-2cd84843bc7c","resolution":{"observed_at":"2026-08-02T21:36:20.529448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:20.594100Z","title":"These issues are easy to overlook but they change learning dynamics and final performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:20.594100Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:fdf00dddd121c0b1464ea51b95d9d96c8bcc4fb9602d4e4128b288d54a8de842","observation_id":"339d6e9c-c26e-4d28-a6e1-2bda3738025a","resolution":{"observed_at":"2026-08-02T21:36:20.594100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:36:20.132246Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T21:36:20.132246Z"},"links":{"citing_paper":"/paper/2602.20220"},"observation_digest":"sha256:81156372622dc15ba4f18ee02aa795824fb53916e61c3a1838340ac0b9653166","observation_id":"fe94c184-2dd8-4ba4-ae7f-302b94df8581","resolution":{"observed_at":"2026-08-02T21:36:20.132246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.20220","last_updated":"2026-07-22T18:26:39Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T17:49:21.760460Z","submitted_at":"2026-02-23T10:34:15Z","title":"What Matters for Simulation to Online Reinforcement Learning on Real Robots"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 5 inbound Pith citation observations for arXiv:2602.20220."}