{"as_of":"2026-07-22T01:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a93ccebcebdfb2b510eb48499271c1669ced4d8f343eb8ae7e37bbb5097e648b","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T08:05:47.128354Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T14:57:49.542416Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T08:59:42.033560Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"cited_work":{"arxiv_id":"2605.00416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00416","snapshot_observed_at":"2026-07-04T08:59:42.033560Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","venue":"cs.RO","work_id":"eb694e18-17e5-4e70-8aa6-0ccdc8f1c60b","year":2026},"citing_paper":{"arxiv_id":"2606.12372","last_updated":"2026-06-10T17:38:24Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:38:24Z","title":"UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:59.746745Z"},"links":{"cited_paper":"/paper/2605.00416","citing_paper":"/paper/2606.12372"},"observation_digest":"sha256:422eb9febea022d1d893387e2b51989e7572aaa82cb7183c40c16ec8654f6490","observation_id":"6de04dfe-12cf-4fbe-8d39-258337ca15b7","resolution":{"observed_at":"2026-07-03T10:58:02.685056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"cited_work":{"arxiv_id":"2605.00416","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00416","snapshot_observed_at":"2026-07-04T08:59:42.033560Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","venue":"cs.RO","work_id":"eb694e18-17e5-4e70-8aa6-0ccdc8f1c60b","year":2026},"citing_paper":{"arxiv_id":"2606.22303","last_updated":"2026-06-21T02:10:21Z","snapshot_observed_at":"2026-07-06T23:57:09.273708Z","submitted_at":"2026-06-21T02:10:21Z","title":"FlowDPG: Deterministic Policy Gradient on Flow Matching Policies for Real-World Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T10:50:24.868343Z"},"links":{"cited_paper":"/paper/2605.00416","citing_paper":"/paper/2606.22303"},"observation_digest":"sha256:922e31be9fb50868d05c7b382900766f5a5e78bd198239dd5dcf36bb81513dd9","observation_id":"42d737be-edc7-42de-a44c-5013aaaf9047","resolution":{"observed_at":"2026-07-04T08:59:42.035183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00416","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Learning while deploying: Fleet-scale reinforcement learning for generalist robot policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-07-16T23:18:04.143464Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2605.00416","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:31cac25aaebf704eb11c89e0e5a7efba6bd4b5b8a4c4d2cbedebc0110627250d","observation_id":"30afc46d-77f9-40f2-8f24-ea6c22132644","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.00416/citation-record","integrity":"/paper/2605.00416/integrity","json":"/paper/2605.00416/citation-record.json","paper":"/paper/2605.00416"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-11T00:07:42.794081Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:d6bf3052754b70ab1b22eab43fac37cc093b05bb79c1b9476a64e3e4da75bd4a","observation_id":"c462da4b-e6a1-491f-822f-04f119b74306","resolution":{"observed_at":"2026-07-01T08:15:32.301652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.018480Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"29c64a5f-4b25-4432-98a3-f6abb5abbac4","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:09fdc6e9915cd84a0b60e4b2d084ae7398ce8cb5f977f7fe7bace5feab6607d2","observation_id":"fabb3f4d-e4b6-409e-a8bd-5b33f29847c7","resolution":{"observed_at":"2026-07-06T13:42:37.019797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-07-10T10:07:00.871229Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:f98f3ee8515c62562824150b1bccf9116a5327f526e03db76ef7567549c4f658","observation_id":"8d8c5cda-965c-4867-b44b-61ee5255f588","resolution":{"observed_at":"2026-07-01T08:15:32.328611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:b4eebc828887c02b85edbfb6395e85d87ae953bd327fa0915001efd3d7da6fb3","observation_id":"0f33576f-9359-43f5-9b31-6b0bc32819a6","resolution":{"observed_at":"2026-07-01T08:15:32.244008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T00:07:42.817654Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:7079667b15fd3862ff4c081371f594edc90842363ca1613329ae87e8640d3e83","observation_id":"b8ccb53a-a27c-48d8-ab89-17ed539b5e6b","resolution":{"observed_at":"2026-07-01T08:15:32.376300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.966532Z","title":"π 0.5: A vision-language-action model with open-world gener- alization","venue":null,"work_id":"eb88a2d8-f164-4a37-b577-73d4df7459bf","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:f1b15e0fbf1c222224e8bdbba6650563b5d3f07c770c04b52db830f8edfd4b3e","observation_id":"0cf90017-53d0-4d79-9ef2-0467b0c9982f","resolution":{"observed_at":"2026-07-06T13:42:36.967936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.002949Z","title":"Hg-dagger: Interactive imitation learning with human experts","venue":null,"work_id":"e93cf5a0-40ff-4960-864e-14ad9c359356","year":2019},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:77c030b73bfa188312cdb6b45583cb1c42331c5c3131a7c1e9fa794c0e3bc825","observation_id":"7d87ea34-b387-4550-b3d8-7ee1509c7d5b","resolution":{"observed_at":"2026-07-06T13:42:37.004270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.008912Z","title":"Q-learning","venue":null,"work_id":"5add4544-969a-4516-8342-3b3700bf2b2e","year":1992},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:0474b0756130d734149d82c1248573d884294550381e0234afc3d0838a574b18","observation_id":"17895e33-1613-4c06-8426-9117b50be000","resolution":{"observed_at":"2026-07-06T13:42:37.010141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.010801Z","title":"Addressing func- tion approximation error in actor-critic methods","venue":null,"work_id":"4826ee0f-a1c7-4c5b-990f-47f0f8649984","year":2018},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:73d3035bce927c035c566c7619786a92ec9b37f1aeb5c2c05fab3ff086176660","observation_id":"da354dc1-2e82-43ce-a670-332ebb0a43bd","resolution":{"observed_at":"2026-07-06T13:42:37.012138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.972535Z","title":"Contin- uous control with deep reinforcement learning","venue":null,"work_id":"fffe0d7d-06ac-4a12-aa54-3a626cba3a3f","year":2020},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:cd97dbb665429d6495c53d9119dd4158dd8b8a13f34901e99645e10e36f2cffc","observation_id":"4de9d740-0529-4809-9502-363d822f9f6c","resolution":{"observed_at":"2026-07-06T13:42:36.974588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.964184Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforce- ment learning with a stochastic actor","venue":null,"work_id":"c393e1c0-bf96-4479-a52e-a4d67ff4ed35","year":2018},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:3110164e4554dc802795308aee113d1a65c4620ee61128a9bc2c1921f5a3adb9","observation_id":"20e703b6-0584-4855-b5fe-6e5dd6f1b146","resolution":{"observed_at":"2026-07-06T13:42:36.965855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.069069Z","title":"Rl-100: Performant robotic manipulation with real-world reinforcement learning","venue":null,"work_id":"a238fe03-5281-4ba1-9da7-5b7129dad2c6","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:c894dde9fa84561d8c513e9530886a34cf35d497e8c7041d1865be8d57109540","observation_id":"8655e183-df38-424e-a622-1e62cb0f2392","resolution":{"observed_at":"2026-07-01T08:15:32.288694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.364043Z","title":"Gr-rl: Going dexterous and precise for long-horizon robotic manipulation","venue":null,"work_id":"4f346bfa-1c16-4774-8008-440611a77af7","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:dc5f3ba0958634c0ba3a01f8f0eeaea35bdaeafc087e1d60cab108e6580ba757","observation_id":"789e75af-6c26-4ef8-807f-f90ae2a241d3","resolution":{"observed_at":"2026-07-01T08:15:32.372068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05450","last_updated":"2025-04-14T04:53:32Z","snapshot_observed_at":"2026-07-06T20:33:11.256513Z","submitted_at":"2025-02-08T05:01:17Z","title":"ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy","version":2},"cited_work":{"arxiv_id":"2502.05450","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05450","snapshot_observed_at":"2026-07-10T23:07:47.914406Z","title":"Conrft: A reinforced fine-tuning method for vla models via con- sistency policy.arXiv preprint arXiv:2502.05450","venue":"cs.RO","work_id":"12e4ef8e-5311-42c5-86de-e8a0c0a4c1c1","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2502.05450","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:d55ea22d6db3587ae342cc629668a234300d60cae8a4075665f71a63d15c0819","observation_id":"c4d77d0f-fb4d-4a20-b8e7-6f69cf9e9c29","resolution":{"observed_at":"2026-07-01T08:15:32.386306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":"2511.14759","doi":"10.15607/rss.2025.xxi.128","metadata_source":"pith","pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","venue":"cs.LG","work_id":"7c1b3355-694a-44c6-880f-631e897e1713","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:d7f894c0033652a8bdaeeb68d1a18878043a55086b9c986b41cfb6327a7c6f6f","observation_id":"31042599-b993-42b1-9b4f-31a07958c008","resolution":{"observed_at":"2026-07-01T08:15:32.263986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.996594Z","title":"Serl: A software suite for sample-efficient robotic reinforcement learning","venue":null,"work_id":"a0d808ac-6a7e-40b0-a5a9-5a8fd97d790e","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:196634a4e715e2f2e62a9dc29b3d2a623a99b5d634b786425741e47caf7d97d1","observation_id":"47a58aa5-fdc0-46bd-a8af-21bfd2e46dd3","resolution":{"observed_at":"2026-07-06T13:42:36.997970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.942059Z","title":"Precise and dexterous robotic manipulation via human-in-the-loop reinforcement learning","venue":null,"work_id":"1bd3f6f4-40c2-4aa1-9487-4783c956c823","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:d4656e1d60f4207f64c9eff74bdd0cd436c6e6d01c278fa98e4d75cf69884e33","observation_id":"b99c4d50-6305-4146-b423-8bda435368b0","resolution":{"observed_at":"2026-07-06T13:42:36.944097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:a68e2d68861699ac3796c7f14456cbacf4d1cb1f25fd204e7cf1b3212373495e","observation_id":"f4b8ac92-607d-4c3c-97a1-5471416adf4d","resolution":{"observed_at":"2026-07-01T08:15:32.305693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.17016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-07-04T20:50:12.325218Z","title":"Interactive Post-Training for Vision-Language-Action Models","venue":"cs.LG","work_id":"1ad0b2af-71bb-415b-b955-e3350f1a1ae8","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:12e0155bff8a756c4ebe91819b03c1e48d3d9801f1ae213ce1c5feb1abb1dd7c","observation_id":"4d23dbfa-1a95-47b7-8b53-3123caaf6da4","resolution":{"observed_at":"2026-07-01T08:15:32.281810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.25889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:09:43.358512Z","title":"pi rl: Online rl fine-tuning for flow-based vision-language-action mod- els.arXiv preprint arXiv:2510.25889","venue":null,"work_id":"30b95f4d-fe3e-40ff-9843-d80d1c9ed4ad","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:76cf926bf51b9746470effd71e4bbeb50d7993fb138ca537e07424ed42c99395","observation_id":"358de7c6-da13-4340-a79c-dbdfb6df5f8f","resolution":{"observed_at":"2026-07-01T08:15:32.254193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":"2505.05470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-07-09T02:25:55.898592Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","venue":"cs.CV","work_id":"bf1e8e81-ff31-401a-a5dc-d9c49df168ab","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:89234dfc03c204364ab2c2858fb9483c8e17e1bfc248d045ab3272529c575818","observation_id":"482c806c-1c8e-4c21-b136-39aab369ef48","resolution":{"observed_at":"2026-07-01T08:15:32.314277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22094","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.723756Z","title":"arXiv preprint arXiv:2505.22094 , year=","venue":null,"work_id":"42e82916-6b94-4acc-9e01-3e78964a96d1","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:349013f5c3d12c5c2af2543c731a7b9a989d45d92bfce2cc9139b01fa52ba0da","observation_id":"3ad599a0-9b5c-4174-99bc-f1362d657a22","resolution":{"observed_at":"2026-07-01T08:15:32.234520Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":"2110.06169","doi":"10.48550/arxiv.2110.06169","metadata_source":"pith","pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","venue":"cs.LG","work_id":"4adca4ff-8975-49b3-aee4-2ef7e0f95275","year":2021},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:693d45bba13928b7079c3bc7ba957a8fbf7fc08c10ace6f6c9763214d5790a8c","observation_id":"d50a8dca-f1c4-4c76-8f91-55a8d8b8ae43","resolution":{"observed_at":"2026-07-01T08:15:32.277366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08861","last_updated":"2025-01-07T18:12:27Z","snapshot_observed_at":"2026-07-06T19:15:00.165369Z","submitted_at":"2024-09-13T14:22:14Z","title":"Adjoint Matching: Fine-tuning Flow and Diffusion Generative Models with Memoryless Stochastic Optimal Control","version":5},"cited_work":{"arxiv_id":"2409.08861","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.08861","snapshot_observed_at":"2026-07-04T08:59:43.270330Z","title":"Adjoint matching: Fine- tuning flow and diffusion generative models with memoryless stochastic optimal control","venue":null,"work_id":"bb57f91f-0416-4cd0-b45d-f5a82e55204f","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2409.08861","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:816c8c2193c3202ee077471a0054d597a765fcddffd3ad0b74e7aeb48f867c1b","observation_id":"109a64ea-7998-4f52-8b58-88895af6c5ef","resolution":{"observed_at":"2026-07-01T08:15:32.357386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14234","last_updated":"2026-05-18T22:43:56Z","snapshot_observed_at":"2026-07-06T22:42:19.252543Z","submitted_at":"2026-01-20T18:45:34Z","title":"Q-learning with Adjoint Matching","version":4},"cited_work":{"arxiv_id":"2601.14234","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14234","snapshot_observed_at":"2026-07-08T11:44:51.136563Z","title":"Q-learning with adjoint matching","venue":"cs.LG","work_id":"dbb69860-e53f-44be-b07b-d0d014ff8d2d","year":2026},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2601.14234","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:1837da94037c4a702c4679e0ef7ef1a6820c316348b8eeb574f401d9db0a6e2d","observation_id":"dad920bd-2f6b-4285-afa8-49afeca480a0","resolution":{"observed_at":"2026-07-01T08:15:32.273179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.012791Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":"54b08d7f-6503-4546-837a-e949e732b508","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:18f5e5ec743a0741d66f54bfd7fb1e2c6cf4d44630b5407ec8c4086d7d7e152f","observation_id":"22a6d22b-569d-45e3-bd86-0be02f5443cb","resolution":{"observed_at":"2026-07-06T13:42:37.014084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-06T19:58:39.778401Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Grape: Generalizing robot policy via preference alignment","venue":null,"work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:b4f526d85d830702951b00b91df6b493ee1ecdbfe642503b441a4fdced4fb6d4","observation_id":"8446b9d6-3128-4dda-b251-182de97f9328","resolution":{"observed_at":"2026-07-01T08:15:32.297095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:59:46.982028Z","title":"Rlinf-vla: A unified and efficient framework for vla+ rl training","venue":null,"work_id":"35c9be3d-4d9b-4400-a921-8946f70ec773","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:05afc76280e748e37eeccd733e8239ef4c08c10f48cc4acd189e088174761991","observation_id":"183d3be4-3e32-49e0-9f9b-a82ef44e7052","resolution":{"observed_at":"2026-07-01T08:15:32.332868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19789","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:50:12.348883Z","title":"What can rl bring to vla generalization? an empirical study.arXiv preprint arXiv:2505.19789","venue":null,"work_id":"c43a0a70-9b6b-42e1-9712-b9b19f7c90a7","year":2026},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:20ee56307a0432c089874edfe9c51d5e477e9cb765e6b5150d0fd4f8d9249a1a","observation_id":"c2c2c579-7846-4540-b5f3-5da937635857","resolution":{"observed_at":"2026-07-01T08:15:32.353236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09858","last_updated":"2024-12-13T04:57:55Z","snapshot_observed_at":"2026-07-06T20:06:21.957662Z","submitted_at":"2024-12-13T04:57:55Z","title":"RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2412.09858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09858","snapshot_observed_at":"2026-07-04T16:49:58.308235Z","title":"arXiv preprint arXiv:2412.09858 (2024) 9","venue":null,"work_id":"dc18ada4-64cb-4f30-bb77-9e188be519f2","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2412.09858","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:4e9216005325a8cf0283f5b775e4ad49ce0d1d15006a288ec6de84f8aaae648f","observation_id":"8f56a2a4-f713-460f-b1f0-517b52dff45c","resolution":{"observed_at":"2026-07-01T08:15:32.390805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.987550Z","title":"Behavior- 1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation","venue":null,"work_id":"74cd66d5-8072-42ed-81b3-30e1f882dcc4","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:0b3bdf8d9184159c064191091fa054fb9000abd56eecba1e0d8c07883e3d0d98","observation_id":"c668455f-d698-42e8-acbf-a0b1b81c651f","resolution":{"observed_at":"2026-07-06T13:42:36.989557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-07-06T11:34:01.629249Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":"2107.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-07-04T13:09:50.093249Z","title":"Maniskill: Generalizable manipulation skill benchmark with large-scale demonstrations","venue":null,"work_id":"a9e80810-91c9-48b5-aef3-61d5da52dc04","year":2021},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:803107c3f46699080c782107f1bda125db938775fb1e635f2f075a573f91090d","observation_id":"f67119e0-be7b-4c26-8ace-554d8a076960","resolution":{"observed_at":"2026-07-01T08:15:32.259437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:56:59.441194Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":"4db3b28f-3a8d-4d55-92e5-1aeade0f1aa0","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:cde363339a99977cbec979e70c4cfe966bff98c7dac82d66c4fe024f3abc5cc0","observation_id":"35779cb1-d0c6-4e75-8dec-b4233fa0f725","resolution":{"observed_at":"2026-07-06T13:42:36.946914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.992285Z","title":"Robotwin: Dual-arm robot benchmark with generative digital twins (early version)","venue":null,"work_id":"9a7bc27f-71ad-43e0-b1b3-72aea0ec42f4","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:44a9f1349157b04b575b65b932fe05efd11ed4220e8e8b7d3060580bbe33b7e8","observation_id":"e9ea6f10-3405-413f-8245-9d2cdaffc4e1","resolution":{"observed_at":"2026-07-06T13:42:36.993608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.07837","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T13:45:46.140796Z","title":"Rlinf-user: A unified and extensible system for real-world online policy learning in embodied ai","venue":null,"work_id":"3d89f653-b822-45a3-a755-b2da8b008ecd","year":2026},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:ea2d3810238bc2341347d6c2420e5cb0737354811e4cdddd17029e6a37813567","observation_id":"1a7652de-82a3-4881-90b4-07dd324576d0","resolution":{"observed_at":"2026-07-01T08:15:32.239243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-07-06T22:45:58.457005Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"cited_work":{"arxiv_id":"2602.13977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.13977","snapshot_observed_at":"2026-07-09T03:05:55.345856Z","title":"Wovr: World models as reliable simulators for post-training vla policies with rl","venue":"cs.RO","work_id":"17804900-10e7-4323-9584-388ff825c14a","year":2026},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2602.13977","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:b506f4f2b7eaa4a370aaf31f9002d07db3578b93bb54577ddde76adc8ad79dd5","observation_id":"713d09b6-8adf-48be-9c14-3c955c9ce917","resolution":{"observed_at":"2026-07-01T08:15:32.346599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.09674","doi":"10.48550/arxiv.2509.09674","metadata_source":"pith","pith_arxiv_id":"2509.09674","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","venue":"cs.RO","work_id":"56dc8355-0011-4fd6-8f89-a6ef5cb6933f","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2509.09674","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:f31dd7afd0a4c18b396962a62748128e5f813e46d6c6bfa3fd9d0f35daa3d43c","observation_id":"d31d1aeb-cb82-4e75-a965-7ce03e0c0556","resolution":{"observed_at":"2026-07-01T08:15:32.395187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.977408Z","title":"Flow q-learning","venue":null,"work_id":"cb22534a-b800-46a5-b8f9-5b0e3afa1be3","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:3fe00700232d8d498908ee9cd7545bd8e83c48102063cd98377cbcaff99f3ac0","observation_id":"d0872b62-2baf-42d0-a71d-be727a5aeaf6","resolution":{"observed_at":"2026-07-06T13:42:36.978628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.979278Z","title":"Uni-o4: Unifying online and offline deep reinforcement learning with multi-step on-policy optimization","venue":null,"work_id":"26859c1d-9ae7-4541-8e1a-8846020d097a","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:330ae2801a5e69db3a08331a12548e917e5d0d6fbd2e7abb122a4da3784ecff9","observation_id":"f2f8e029-05fd-47a5-9928-94a5a2510b04","resolution":{"observed_at":"2026-07-06T13:42:36.980895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.985478Z","title":"Offline- to-online reinforcement learning via balanced replay and pessimistic q-ensemble","venue":null,"work_id":"ec085baf-34df-4ec0-8a0f-eed57100bf1c","year":2022},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:9038fa08dd67a49af2193ae2f5476a4c2d5fb7b297ae8d34cc3e6b6e80821096","observation_id":"b5d88aa3-9402-4fad-a5f9-d67244d7aa3c","resolution":{"observed_at":"2026-07-06T13:42:36.986777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.975270Z","title":"Reincarnating reinforcement learn- ing: Reusing prior computation to accelerate progress","venue":null,"work_id":"245225f7-6b48-4277-812e-1e1649ece531","year":2022},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:d69f1776ab5ad29be01a836971e7007f3c5f012b1a3e9bc2d88ed78f36129aa9","observation_id":"8bbff4a3-ff21-46d1-9343-e5b0b819ff65","resolution":{"observed_at":"2026-07-06T13:42:36.976756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.004926Z","title":"Effi- cient online reinforcement learning with offline data","venue":null,"work_id":"e81d421a-e537-43c3-b324-499d9f5a2668","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:fbaee9fad9a3a872b7174f626c9f30691799270773c4c8c333699e133d42f3c7","observation_id":"f859429f-2929-4a77-b7bb-0e2ab517c43a","resolution":{"observed_at":"2026-07-06T13:42:37.006226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":"2006.09359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-07-08T22:35:40.693821Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","venue":"cs.LG","work_id":"f0a11265-1acf-4ffc-a822-08bd04b6bddf","year":2020},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:edda728ebf5faf1e77cf258d410a68d602d500687c9b41462963c90029fdfca1","observation_id":"e8b82892-7e02-4b72-aec3-04041763d612","resolution":{"observed_at":"2026-07-01T08:15:32.337531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-07-06T14:04:32.971017Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":"2210.06718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-07-04T20:50:12.306741Z","title":"Hybrid rl: Using both offline and online data can make rl efficient.arXiv preprint arXiv:2210.06718","venue":null,"work_id":"8fb00ca1-66c0-40d6-afc0-2a7a66816789","year":2022},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:94e58b66cdc9ad54d68f75e40440f6830dad9c4d0ac683be5bf99a9e128f6d8d","observation_id":"39a0a6bc-4bbd-43fc-b36f-1e8850532b61","resolution":{"observed_at":"2026-07-01T08:15:32.342064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.15799","doi":"10.48550/arxiv.2506.15799","metadata_source":"pith","pith_arxiv_id":"2506.15799","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","venue":"cs.RO","work_id":"9a890f5d-e935-4243-a46c-3637ed62e501","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2506.15799","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:c1c85c1d62938eda3995da06552816104b557700c8789361211f49c42989d685","observation_id":"d4d498a3-e9d2-4bfd-b160-d7e76b4381fa","resolution":{"observed_at":"2026-07-01T08:15:32.362409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.961892Z","title":"Qt-opt: Scalable deep rein- forcement learning for vision-based robotic manipula- tion","venue":null,"work_id":"7b23d5d2-fbb8-4d91-9bf4-9747c9fffe57","year":2018},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:ac281199b206bab8bf3daff2254c07742c234caf92cc56eb0291495f8229ff47","observation_id":"66da4269-1d56-4946-8c15-7a1729571d80","resolution":{"observed_at":"2026-07-06T13:42:36.963482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08212","last_updated":"2021-04-27T20:06:33Z","snapshot_observed_at":"2026-07-06T11:00:25.253720Z","submitted_at":"2021-04-16T16:38:02Z","title":"MT-Opt: Continuous Multi-Task Robotic Reinforcement Learning at Scale","version":2},"cited_work":{"arxiv_id":"2104.08212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08212","snapshot_observed_at":"2026-07-04T06:19:37.558783Z","title":"Mt-opt: Continuous multi-task robotic reinforcement learning at scale","venue":null,"work_id":"d4b61039-1d94-42db-8c6d-4c49c037e711","year":2021},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2104.08212","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:e427d2bca68fc13d51feec3c6680d1cb05ef7885693501f2bfc5c09c0a92d29b","observation_id":"19d92e87-c654-4ea4-a22e-77542f76a7d5","resolution":{"observed_at":"2026-07-01T08:15:32.309954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.022474Z","title":"Pi-qt-opt: Predictive information improves multi-task robotic reinforcement learning at scale","venue":null,"work_id":"69aa9e02-73b3-4e94-9403-e75569c67595","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:6b4153fca808a8a6be071aa7c36b742780de5241ea14b4a0a17aaac3ffe20c08","observation_id":"17c5cc86-2c1e-40aa-b398-c061d477a16f","resolution":{"observed_at":"2026-07-06T13:42:37.023775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.03044","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.359633Z","title":"Sop: A scalable online post-training system for vision-language-action models","venue":null,"work_id":"5d2500ee-848d-4fc9-82c8-2063a27bf930","year":2026},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:5a0fb8a940d5f5ecf25494144fafce0a8b281a6875c3ed11e608128474d0d4e3","observation_id":"902a7074-8583-4df7-9736-685928302ae9","resolution":{"observed_at":"2026-07-01T08:15:32.366990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11706","last_updated":"2023-12-22T13:55:42Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:35:20Z","title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2306.11706","doi":"10.48550/arxiv.2306.11706","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.11706","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Robocat: A self-improving foundation agent for robotic manipulation","venue":null,"work_id":"143e7731-0488-4088-8e23-63f9d4140118","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2306.11706","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:6b974e2e72869a57e12b99d8c66c5eeac198116923d86a6794887e88e5723b3c","observation_id":"5448ea69-3db1-4919-9941-7a1bec6e497f","resolution":{"observed_at":"2026-07-01T08:15:32.324014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.998738Z","title":"Impala: Scalable dis- tributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":"2e55c5e4-eb7d-4d1c-a7bc-29fdec66abb6","year":2018},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:a0abec58aff2864a6ff097abeca989bbcc6e1726c4c1a2b3a368de52bd5235f3","observation_id":"633d21ce-7b75-4db9-8bda-139822ac0c4b","resolution":{"observed_at":"2026-07-06T13:42:37.000134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03270","last_updated":"2023-05-05T04:01:20Z","snapshot_observed_at":"2026-07-06T15:23:33.023871Z","submitted_at":"2023-05-05T04:01:20Z","title":"Deep RL at Scale: Sorting Waste in Office Buildings with a Fleet of Mobile Manipulators","version":1},"cited_work":{"arxiv_id":"2305.03270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.03270","snapshot_observed_at":"2026-07-04T01:29:22.888024Z","title":"Deep rl at scale: Sorting waste in office buildings with a fleet of mobile manipulators","venue":null,"work_id":"175da461-4c1e-42be-9dff-b21b03502027","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2305.03270","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:b17e1468a3483d79ae85e23a94b882c6664a8bfd220769e757b34ff1d930a35c","observation_id":"37424740-b8c3-4ff7-899f-7c0f9d55b8e9","resolution":{"observed_at":"2026-07-01T08:15:32.381350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.014728Z","title":"Flow matching for generative modeling","venue":null,"work_id":"7ff6343c-1161-4c89-9944-0f32db22c2db","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:7bbe4d094fde096dafb62d4c229fb25764ec8365b5f74f07f2eff856d4643066","observation_id":"c63998fc-d28f-4cdd-b489-ffdc73bd3dcb","resolution":{"observed_at":"2026-07-06T13:42:37.015969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.983566Z","title":"A dis- tributional perspective on reinforcement learning","venue":null,"work_id":"e924c069-79a0-47d0-a0e2-cf50fe665b3f","year":2017},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:8fe8991a2e20451c898fcffcdea210e0cc2ef627219c6d135cdda89b6a1ff321","observation_id":"c43499ee-d956-4d65-ab8b-c9462145ed13","resolution":{"observed_at":"2026-07-06T13:42:36.984857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15144","last_updated":"2023-04-17T18:45:23Z","snapshot_observed_at":"2026-07-06T14:23:47.116494Z","submitted_at":"2022-11-28T08:56:42Z","title":"Offline Q-Learning on Diverse Multi-Task Data Both Scales And Generalizes","version":2},"cited_work":{"arxiv_id":"2211.15144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.15144","snapshot_observed_at":"2026-07-01T08:15:32.316103Z","title":"Offline q-learning on diverse multi-task data both scales and generalizes","venue":null,"work_id":"67a269bd-015a-4d67-afe9-a2b97b4b2482","year":2022},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2211.15144","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:e4197efa279a859890795abaafe218a58a02020eb268f3744c5c686b65e8e3fa","observation_id":"2c291311-8889-4673-b059-44ecf5f1b6c6","resolution":{"observed_at":"2026-07-01T08:15:32.319056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-07-10T23:07:47.949672Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:b6df8eaa99aac6805cbadf8a43306716acb0d734a649dbe2879a11e5492b552c","observation_id":"c74f5f11-bd6d-4522-8274-9e8f19b811fa","resolution":{"observed_at":"2026-07-01T08:15:32.268543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.968589Z","title":"Energy-weighted flow matching for offline reinforcement learning","venue":null,"work_id":"68de90da-0920-4e01-8c07-66cd98d3e307","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:d2269db2cf6d3fb9aa3dc714707920c3420397ca14e0b8dfa12ddae0c467cf36","observation_id":"d5fa6e00-a2c0-46c4-81bd-6d9de680ed09","resolution":{"observed_at":"2026-07-06T13:42:36.969944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.970596Z","title":"Gemma 3 technical report","venue":null,"work_id":"564110c2-c2e8-4ddd-a8b2-418fa41cde46","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:523f5b80d3bb60747a8a83adf3533ecb9d84f1937ccfbb33d0eab7f3c17491a0","observation_id":"9e25219c-802b-430f-b70e-b129003c16bb","resolution":{"observed_at":"2026-07-06T13:42:36.971846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.947697Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"802b1f8b-e0f0-4bf3-b1ba-82b052dbef17","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:682e67e84740252981eaece60735254b253f423dd64e39475a2194736041f0a6","observation_id":"7b0b1d20-208b-4754-8474-657d6830b089","resolution":{"observed_at":"2026-07-06T13:42:36.949397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:2860717ac5877d30125fbca3d3fc9026dee86a0a158110efd994794020f831e9","observation_id":"0a6dd454-d857-412b-8905-d434933e510d","resolution":{"observed_at":"2026-07-01T08:15:32.248894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.016587Z","title":"Vision trans- formers for dense prediction","venue":null,"work_id":"54fd7fab-6b47-4f22-bdd9-6f058dc1a709","year":2021},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:ebf9c60d6ffc7a342efef4b518108f41c21e148d3ba2aca864860e4e1d42f5b2","observation_id":"a91f9f70-303e-4390-a230-56c7157b4ba8","resolution":{"observed_at":"2026-07-06T13:42:37.017860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.006890Z","title":"Blip-2: Boot- strapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"65e006a2-4309-4a08-a121-0d7d50c8f169","year":2023},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:f0aaf32026fad3755a6dd730dd94905448473a2076c43d5219fb38e56f7cde36","observation_id":"38067fb4-b886-4c5c-8678-4df8ad88fafe","resolution":{"observed_at":"2026-07-06T13:42:37.008267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.000862Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"c935a6e8-9d01-49c8-ace1-ecd6e646f861","year":2019},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:b0504b9eed91da6de3c8dfaa55653599c2919ba5bb14a40c7b33d29cbb3fef5e","observation_id":"0b80b7f0-6563-4815-853a-8376770dd978","resolution":{"observed_at":"2026-07-06T13:42:37.002272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.024407Z","title":"In our real- robot experiments, we useK= 201atoms over[−0.1,1.1]","venue":null,"work_id":"758625de-56cb-47b8-9bd4-a7e7fabd360f","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:31c50da74391c85add9a9c26974116f7251531bb9fc58c260f15dd6f67461b23","observation_id":"bb11bb1a-f882-465e-9f6d-256642ab8e5f","resolution":{"observed_at":"2026-07-06T13:42:37.025765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:37.020551Z","title":null,"venue":null,"work_id":"2aad1579-f4f9-4e95-a459-db09beab2a80","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:e567296a4a0d052b1c8ad3e6cf03b5a4c076467c1e5f99c615d47537badd14d8","observation_id":"fdb24c82-a66f-421d-9ad7-90692f548c5f","resolution":{"observed_at":"2026-07-06T13:42:37.021848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.950126Z","title":null,"venue":null,"work_id":"95b21ada-2973-4580-a6a4-d5e4ffa9bad9","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:d867d4f798424967441e3c6f4e4a366c398916c4d41d5e576a44338e0609acea","observation_id":"1492b493-37db-4baf-b0a7-485dec5690ce","resolution":{"observed_at":"2026-07-06T13:42:36.951626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.930088Z","title":"Demonstrations are successful trajectories, rollouts contain both successes and failures, and play data is treated as unsuccessful exploratory data","venue":null,"work_id":"bfe53178-a0b9-4888-b4ff-1ab7c25bb6ff","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:b6981ac95616c7ce40a09b54a01a8799e592166182b1d4d7724f63e27acd8af4","observation_id":"954c73f3-0eb1-4fad-ab9d-325d18f39c9b","resolution":{"observed_at":"2026-07-06T13:42:36.940526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.994346Z","title":"The policy is optimized with AdamW [63] using a base learning rate of2×10 −5 and a cosine decay schedule","venue":null,"work_id":"730b4342-2413-4ddc-9e91-ad3735b9072a","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:dbd2226ada3da212a0925ae4c4a4f6d96bda02700f06e54f4531705ee5b9035f","observation_id":"58af25cc-d75f-4e8c-b548-e1ff60d54e12","resolution":{"observed_at":"2026-07-06T13:42:36.995805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.954990Z","title":null,"venue":null,"work_id":"acdfd49a-ad93-40d1-a5b3-6912252dfe24","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:274515ccd08e1f63808c7033997d5b9c5ba4c3babe560c5d7dd9b8d65b247bc9","observation_id":"c18fac3f-1573-45d4-be3e-c108997614bd","resolution":{"observed_at":"2026-07-06T13:42:36.956522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.959495Z","title":"The model is trained with a flow-matching loss, where the interpolated noisy actiona w is defined in Eq","venue":null,"work_id":"5f55ea7e-dfd4-4060-85f4-3e2bba1fbf82","year":2000},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:d1d6c4c74ee36c7160054f110789b497f31b4c31e40fc5c585f446e6463cc80b","observation_id":"396975de-941d-452b-8b0c-deb512f0c24a","resolution":{"observed_at":"2026-07-06T13:42:36.961158Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.990172Z","title":"The comparison isolates the Robot 1 Robot 2","venue":null,"work_id":"2da95105-abd8-486c-97fc-364fb3131012","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:e75eea4750cee214f152e23a3dcbed4281cde3832d3db164d8e1ee7f67e0f0fc","observation_id":"18f88483-d5e8-43b7-b1f3-9a39d2806629","resolution":{"observed_at":"2026-07-06T13:42:36.991664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.952374Z","title":"9 vi- sualizes the predicted value distributions for the same episodes shown in Fig","venue":null,"work_id":"022d5b04-a038-469d-9d5f-0d633588a132","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:127b143d7a8a5d043f0d69a0725666af51facce974759953fd734cbd876a8d61","observation_id":"595baa96-96fe-431c-bcb7-16445fcc92d6","resolution":{"observed_at":"2026-07-06T13:42:36.954173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.981523Z","title":"(i) Object-storage uploads commit atomically (read- ers see either the fully-uploaded payload or no object) and are retried until persisted","venue":null,"work_id":"31ba16b3-524c-4b31-bc34-ebeb1541f2d7","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:46402d5e9f55a77d373e8bdbc1c5d7e12e04c9f93549354ab968f80d18c0715c","observation_id":"09c10d04-97e4-410b-9d6e-efb8489b620d","resolution":{"observed_at":"2026-07-06T13:42:36.982931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T13:42:36.957180Z","title":"Table VI reports both on the same 8-hour, 16-actor run as the End-to-End Reliability subsection above","venue":null,"work_id":"a4633982-ad7b-4e8e-82e7-b864a796672a","year":null},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:35f275a8d43835f51c7ba75f6e1b4cf4d85e694fa768ead8a1c2a4e71cc2d18e","observation_id":"d87dbcdb-4e25-47a0-aec3-82a14d10eb4a","resolution":{"observed_at":"2026-07-06T13:42:36.958802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":32,"verified_fuzzy":39},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 74 of 74 outbound references and 3 inbound Pith citation observations for arXiv:2605.00416."}