{"as_of":"2026-08-13T13:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6627b4298513e56bd86f56bd3761a9dc24952515805b51a4f77f2339a9d715b","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T12:55:40.245908Z","state":"measured"},{"denominator":167,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":167,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":74,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:20:19.953071Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T23:07:47.932038Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-06T23:36:13.013125Z","title":"Vla-rl: Towards masterful and general robotic manipulation with scalable reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17639","last_updated":"2026-06-16T03:02:33Z","snapshot_observed_at":"2026-08-07T21:39:08.232650Z","submitted_at":"2025-06-21T08:45:32Z","title":"RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:36:13.013125Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2506.17639"},"observation_digest":"sha256:4a4189f74845b0d9573b929c08061717834caeb78000cb06c3ae221e612d19af","observation_id":"eca419b8-08fd-41a2-847b-86be3a85d6b5","resolution":{"observed_at":"2026-08-06T23:36:13.013125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":181,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:522549b354169777a9cac1028b007be45c044f21ccb4562b2925d975bfc56b35","observation_id":"95ea6872-0446-4211-8b8c-e7c1baa73fb1","resolution":{"observed_at":"2026-05-17T20:28:16.127771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-05T10:30:23.605483Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-10T04:02:44.332056Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.605483Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:e9c2f7aab10bbf48554a4f230219bc2b4539fb17dc9fc8b14ebb9e05a61e80f2","observation_id":"7cc1bd6a-b221-4f54-b7e7-2c0543864e5a","resolution":{"observed_at":"2026-08-05T10:30:23.605483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T12:42:46.978148Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2509.06951"},"observation_digest":"sha256:578b504d33e11efadead45c1ade8c3e3032164bb985ab7fe622ac95a85584679","observation_id":"bfb3efbf-d878-4a51-ad43-ad1dee69dac5","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:11.189795Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2509.09674"},"observation_digest":"sha256:498ab8f850cb7f5a257aaca27a0b42d3225da24f0fd437fe41cf3de332e90177","observation_id":"97d017ce-8497-4e0b-8cd1-d2c3c6eff92c","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2510.02590","last_updated":"2026-05-18T11:40:07Z","snapshot_observed_at":"2026-08-12T22:31:24.544355Z","submitted_at":"2025-10-02T21:48:01Z","title":"Use the Online Network If You Can: Towards Fast and Stable Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T21:33:40.229376Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2510.02590"},"observation_digest":"sha256:53e00eb9ca97c05f60da3c414b914f70b523aac74ce56fc74088fb89cc56172c","observation_id":"f4cc08e2-a87f-432b-ab5f-013e68fd6365","resolution":{"observed_at":"2026-05-21T21:34:22.289168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T06:20:01.885711Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:4310343c4ae4c0398db14b9fd48f7e21fe3cb0195e6d9f396d3a5bcaa0a57034","observation_id":"1ac2bdf5-083d-4463-beb1-d9c17d00f5f2","resolution":{"observed_at":"2026-05-17T06:20:01.988199Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-04T11:38:54.514977Z","title":"Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, and Irwin King","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T11:38:54.514977Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:8b27fefe8bcc79311782ec3b3205d903ad72c9c03fa9487e3733d868bb2556f0","observation_id":"985939ba-55d8-42ff-9a0a-150adb4c5433","resolution":{"observed_at":"2026-08-04T11:38:54.514977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-04T10:24:55.949494Z","title":"VLA-RL: Towards Masterful and General Robotic Ma- nipulation with Scalable Reinforcement Learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09976","last_updated":"2026-06-25T14:25:12Z","snapshot_observed_at":"2026-08-10T21:19:26.143305Z","submitted_at":"2025-10-11T03:11:18Z","title":"Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:24:55.949494Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2510.09976"},"observation_digest":"sha256:87ab383982a734868a79ffdf64c44879a1f5c864f43182e32b044af72b51c314","observation_id":"3a7f4c9f-d4c4-4287-b44e-bfbaeb708d9f","resolution":{"observed_at":"2026-08-04T10:24:55.949494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2510.12710","last_updated":"2026-04-09T08:55:45Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-14T16:44:39Z","title":"Reflection-Based Task Adaptation for Self-Improving VLA","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T07:28:11.187479Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2510.12710"},"observation_digest":"sha256:690ccb698e2eaa9bd1819c68531ea078363a2cc0985f8743f180bcea623cda81","observation_id":"c3dc4031-dc1f-441d-906d-44316b796107","resolution":{"observed_at":"2026-05-18T07:31:02.950270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2510.17640","last_updated":"2026-08-05T02:51:23Z","snapshot_observed_at":"2026-08-08T23:09:05.210442Z","submitted_at":"2025-10-20T15:21:12Z","title":"RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T06:10:47.309028Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2510.17640"},"observation_digest":"sha256:2f5795290ad0983b8866d7dde51a7d14b05ba087831b8a99d9305456726eee6f","observation_id":"45c86c92-7ae0-4ca6-8b7d-af521de763d1","resolution":{"observed_at":"2026-05-18T06:10:57.839817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T10:34:59.134604Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2511.14759"},"observation_digest":"sha256:b907a56ec48f9e489d60318b05372e8b7bb109b30a7d913a78acb87c66f5beca","observation_id":"18c063c8-8a2b-4822-85b1-e981fe93cbcf","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2511.15669","last_updated":"2026-08-05T03:23:59Z","snapshot_observed_at":"2026-08-08T23:09:08.696409Z","submitted_at":"2025-10-31T05:26:16Z","title":"DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-18T03:09:09.713822Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2511.15669"},"observation_digest":"sha256:d76abed27a18423971afae82b2e6ae6346f3079d1df464dc226a920edb80014c","observation_id":"39b4ac06-45b2-4ad4-9346-891b67d65b1a","resolution":{"observed_at":"2026-05-18T03:10:48.847422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2511.18082","last_updated":"2026-04-13T14:33:40Z","snapshot_observed_at":"2026-08-11T02:22:51.293115Z","submitted_at":"2025-11-22T14:44:03Z","title":"ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T06:07:42.311608Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2511.18082"},"observation_digest":"sha256:c86616098d8a8603d901f00eeaf60435fd7db2d1420d18359c5ce1b5afe74443","observation_id":"faf27b8d-eb4f-4e81-af34-248ece198293","resolution":{"observed_at":"2026-05-17T06:09:09.446324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2602.05765","last_updated":"2026-04-07T08:14:29Z","snapshot_observed_at":"2026-08-11T08:09:32.846596Z","submitted_at":"2026-02-05T15:30:23Z","title":"RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T07:01:54.696390Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.05765"},"observation_digest":"sha256:00fe521f6c9186fc85ed06edf9785e0059d4322b81c13589a97448bb90f120f9","observation_id":"530a6ef8-e99d-4078-bf48-544523076412","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-03T03:56:47.172497Z","title":"Vla-rl: Towards masterful and general robotic manipulation with scalable reinforcement learning.arXiv preprint arXiv:2505.18719, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06508","last_updated":"2026-05-25T03:56:37Z","snapshot_observed_at":"2026-08-03T03:56:46.452714Z","submitted_at":"2026-02-06T08:57:55Z","title":"World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:56:47.172497Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.06508"},"observation_digest":"sha256:7a0a9bdbbb0c8a289c148650d6baa2a2efbe567186dc3ba1059b89ade082155e","observation_id":"4f9935aa-8b8d-40cc-9b71-483af13c20c6","resolution":{"observed_at":"2026-08-03T03:56:47.172497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2602.09023","last_updated":"2026-05-19T02:18:04Z","snapshot_observed_at":"2026-08-02T13:36:40.045905Z","submitted_at":"2026-02-09T18:59:52Z","title":"TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:53.818915Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.09023"},"observation_digest":"sha256:a5c3a40fe399cb777b25621291b4edbe45b7ffd2dc580f3ed91754ca3f2205d0","observation_id":"6a0d8fac-a5cc-409a-a21b-43b808db6e14","resolution":{"observed_at":"2026-05-21T13:14:10.829151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2602.10503","last_updated":"2026-05-16T03:35:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-11T04:05:03Z","title":"Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T14:07:10.387869Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.10503"},"observation_digest":"sha256:0bbdede3d6673b4dad4b0c1da9670bb3f699569f8e1010e3d08819cc6146c742","observation_id":"ea9a4a92-774d-4402-8c7a-0038384e2946","resolution":{"observed_at":"2026-05-21T14:10:13.210273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2602.10698","last_updated":"2026-02-11T09:57:32Z","snapshot_observed_at":"2026-08-11T15:16:51.530916Z","submitted_at":"2026-02-11T09:57:32Z","title":"AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T06:01:30.803128Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.10698"},"observation_digest":"sha256:e519949ed9927b80eba8c8e2ea605935cf05b6c3cad62d91362a45308fe42164","observation_id":"fc388521-7d39-4880-ada3-0e86fdca0b00","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T02:28:37.997148Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.11075"},"observation_digest":"sha256:d220cd66cfff8398abbee5f3cff10376d3b9d08570e083f727fd3deeceb2ae58","observation_id":"e2d9f503-7dbc-4b8a-bfe0-f781d72545c3","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-02T23:47:56.865774Z","title":"Vla-rl: Towards masterful and general robotic manipulation with scalable reinforcement learning.arXiv preprint, arXiv:2505.18719, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12691","last_updated":"2026-06-20T06:22:27Z","snapshot_observed_at":"2026-08-13T03:32:53.422908Z","submitted_at":"2026-02-13T07:46:37Z","title":"ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T23:47:56.865774Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.12691"},"observation_digest":"sha256:26dd5f1ad866c423df19469feba20f2b330c02553f75f51355577989b2df7c1e","observation_id":"060211d4-f4da-40b0-ab13-77d5039ca6a8","resolution":{"observed_at":"2026-08-02T23:47:56.865774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-02T23:23:52.056025Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-08-13T08:13:07.633070Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:52.056025Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.13977"},"observation_digest":"sha256:00c91f874bcf8060cf0c9f902402dcada07ccb1e5c38b6c588d331210eebf0a6","observation_id":"f7dd5d3a-bad9-4576-b747-d22c80cb96a8","resolution":{"observed_at":"2026-08-02T23:23:52.056025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:cfc7d7c6aff7ed65143c8b3de5a7cd84f5d9d0f526add7c438805da6de15ac11","observation_id":"bb374873-0a04-4ebc-b858-0cd97984f424","resolution":{"observed_at":"2026-05-21T13:00:09.810733Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-02T18:48:52.392191Z","title":"Vla-rl: Towards masterful and general robotic ma- nipulation with scalable reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.05147","last_updated":"2026-07-25T16:39:34Z","snapshot_observed_at":"2026-08-09T18:22:28.271593Z","submitted_at":"2026-03-05T13:14:41Z","title":"Act, Think or Abstain: Complexity-Aware Adaptive Inference for Vision-Language-Action Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:48:52.392191Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2603.05147"},"observation_digest":"sha256:ae6f262d3a341475cc9905b92475cc7b3dbce7c36bfdef65933ec240deefd267","observation_id":"71402313-8f76-4efc-a5be-c6222c35c19a","resolution":{"observed_at":"2026-08-02T18:48:52.392191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2603.15757","last_updated":"2026-06-19T13:49:25Z","snapshot_observed_at":"2026-08-11T06:00:16.206166Z","submitted_at":"2026-03-16T18:00:19Z","title":"You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T09:53:45.151347Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2603.15757"},"observation_digest":"sha256:97011e9c2fd8a5c93aaf350a7c930473d1a0c5e2f34d8aa1e2651b7e4d57ad14","observation_id":"c6932cf6-92e9-4687-a09c-c077f07da32c","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-13T13:17:06.175932Z","title":"Vla-rl: Towards masterful and general robotic manipulation with scalable reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03531","last_updated":"2026-04-04T00:30:43Z","snapshot_observed_at":"2026-08-08T05:26:58.057935Z","submitted_at":"2026-04-04T00:30:43Z","title":"Genuine pair density wave order on the kagome lattice","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T13:17:06.175932Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2604.03531"},"observation_digest":"sha256:9087c0477a6a0ac0cd6f2ce9666757580e929cc5c9a68484a69778c4ac70d398","observation_id":"53f5ac62-5448-487b-900b-019c9836294a","resolution":{"observed_at":"2026-07-13T13:17:06.175932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2604.04834","last_updated":"2026-06-30T15:42:53Z","snapshot_observed_at":"2026-07-13T09:40:35.215938Z","submitted_at":"2026-04-06T16:35:57Z","title":"E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T20:21:45.365156Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2604.04834"},"observation_digest":"sha256:f445aaa5aab24ed0959ff91bcbe452ea8286495ed2cc32eb1f13b3bec6ca0a6c","observation_id":"1e6b6c48-e063-4011-a61f-480bd6c2a56b","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2604.06725","last_updated":"2026-04-08T06:47:55Z","snapshot_observed_at":"2026-08-11T09:01:03.540299Z","submitted_at":"2026-04-08T06:47:55Z","title":"Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:46.753641Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2604.06725"},"observation_digest":"sha256:571571eb697fcaac799cf553bff35867bec6a8df567303bf0f89e80f6fcc8039","observation_id":"df059891-b1b1-4286-840f-2eed7ad45c5e","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2604.10165","last_updated":"2026-04-11T11:24:39Z","snapshot_observed_at":"2026-08-11T09:22:38.173071Z","submitted_at":"2026-04-11T11:24:39Z","title":"MoRI: Mixture of RL and IL Experts for Long-Horizon Manipulation Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:01:11.260956Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2604.10165"},"observation_digest":"sha256:c945373c39c7d077445d76d669ad0793739cb6fb1b74b5c113d75ece324c0d1f","observation_id":"09a50abc-79d3-432d-8864-bfc7c9ac95e0","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2604.17706","last_updated":"2026-04-24T09:42:43Z","snapshot_observed_at":"2026-08-11T02:44:24.532920Z","submitted_at":"2026-04-20T01:36:58Z","title":"OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T05:16:57.241755Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2604.17706"},"observation_digest":"sha256:19c6f7d336b4ec20793cc151d6967e6f82a0fda64f4b9e5e143f171c1b77179c","observation_id":"be4f14e8-f806-42b4-b890-95755c6f7577","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T22:07:24.208555Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:d3060b891a1294e40b9603d2ad26487e82d5394c6cb314a21e4a35075a8aff6b","observation_id":"16caa9cb-90b4-4183-9026-3738f13700f0","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-12T18:39:49.173828Z","title":"Vla- rl: Towards masterful and general robotic manipulation with scalable reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T18:39:49.173828Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:0cb80b7a6776b478a0bf7c76391027be9f4e35aa4d50a70666777ff6668ba049","observation_id":"938c5fd9-e0a6-460a-892c-4fe583d2a80a","resolution":{"observed_at":"2026-07-12T18:39:49.173828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-11T13:04:08.180508Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T05:47:17.494531Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:64b57dc5cc1bd7302baf4b6580c9d129430d41630df21bfff2e87622be264972","observation_id":"ad842d11-fe5b-4896-95dd-4c9f93f4911e","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-11T13:04:08.180508Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T03:00:26.352130Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:46fe8c4c973c286aa25a430349a28005a0c910f65c5a5bc2f5388b8f6e0a63e1","observation_id":"ddf9aa26-5cc4-4740-a75c-80c8a46728f6","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T19:31:38.069592Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:1fda98b190660e087e66a0637f9cdc658e5939e411add47e4794081b6be794b7","observation_id":"5d43047d-35d9-4f0b-b2d4-c2bfc2fdb059","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:f42d8a06ba152ee2efe70dfe28fbf5d686f81dd6991befc5aeed3b3364754b77","observation_id":"f4b8ac92-607d-4c3c-97a1-5471416adf4d","resolution":{"observed_at":"2026-07-01T08:15:32.305693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.05711","last_updated":"2026-05-07T05:55:50Z","snapshot_observed_at":"2026-08-03T03:45:21.803269Z","submitted_at":"2026-05-07T05:55:50Z","title":"Closing the Loop: Unified 3D Scene Generation and Immersive Interaction via LLM-RL Coupling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T14:53:46.528750Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.05711"},"observation_digest":"sha256:c68984818a217fc29086da3a5299bc7a71dd134e2867ceda236cff78a6e24088","observation_id":"97e60cf9-582a-4d3c-add6-fca7f9bf2ddc","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-12T23:04:14.451687Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:43.222818Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:c8ee839577552218aa4c9017c394d42959e17645ffa139b48db1c0c360ab1bdb","observation_id":"b023fe87-8298-4c0a-b15a-bfd05d702541","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-02T14:26:01.263542Z","title":"Vla-rl: Towards masterful and general robotic manipulation with scalable reinforcement learning.arXiv preprint arXiv:2505.18719, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.10821","last_updated":"2026-07-16T12:45:34Z","snapshot_observed_at":"2026-08-12T23:04:14.451687Z","submitted_at":"2026-05-11T16:37:34Z","title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T14:26:01.263542Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.10821"},"observation_digest":"sha256:cf1a7486e4bbe44ade482dbf0ac21de0d4c8f2ee0b8e3341c280a600d3636dc9","observation_id":"f980e6c3-9153-44e2-a584-a2759dc964df","resolution":{"observed_at":"2026-08-02T14:26:01.263542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-08-11T14:05:14.712018Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:7f7c52de961cebd17d1ee3bcf377eeca4cba31d4e2142c85680d5f0c9bd014b2","observation_id":"51e9b58d-dd57-4457-a838-e13fe2cadfbe","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.12334","last_updated":"2026-05-20T07:28:11Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:16:15Z","title":"Reinforcing VLAs in Task-Agnostic World Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T04:17:51.349213Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.12334"},"observation_digest":"sha256:1df71a48d745b32b3d7ae8c7104d213af0ca407518162935ca502853c0b3b4c7","observation_id":"ccf925a0-4a78-4ea3-9ece-2b27b9772ded","resolution":{"observed_at":"2026-05-16T12:55:40.591564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.12334","last_updated":"2026-05-20T07:28:11Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:16:15Z","title":"Reinforcing VLAs in Task-Agnostic World Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T08:13:40.975340Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.12334"},"observation_digest":"sha256:5f4f9c357623b00041a265419ba0d43a94b580e1f3cdbef0de8a2fb08067ba96","observation_id":"3eadb395-ff74-472b-86e7-b2924a69d19c","resolution":{"observed_at":"2026-05-21T08:14:03.147881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.16154","last_updated":"2026-05-15T16:33:59Z","snapshot_observed_at":"2026-07-06T23:27:20.429737Z","submitted_at":"2026-05-15T16:33:59Z","title":"Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T21:05:45.024226Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.16154"},"observation_digest":"sha256:cef1006834b572101f81498bc7d1bd45e18293dab5509705c42200f96968569a","observation_id":"1455a558-33c1-41c5-84a7-6f441d26eda7","resolution":{"observed_at":"2026-05-20T21:09:02.704069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:1da1d8d2449bb54d74004f28b00ac556e249eef55c01d01cca34afd2052d20cb","observation_id":"bc55fd09-e136-4a2b-852c-2c7435e9a8a9","resolution":{"observed_at":"2026-05-20T12:43:16.978981Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:8ef7146071697a8e1cf04be9513201405a05f31582ea569237411d435f88e196","observation_id":"d7845171-13e2-4158-8031-77b30695902b","resolution":{"observed_at":"2026-05-20T12:53:17.670684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.19678","last_updated":"2026-05-19T11:10:20Z","snapshot_observed_at":"2026-08-11T18:07:37.597577Z","submitted_at":"2026-05-19T11:10:20Z","title":"RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T04:48:39.069675Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.19678"},"observation_digest":"sha256:0c281cc6760dbd6e96155cc8f153e673faad33cb0ff4008ef51543605987e74b","observation_id":"56dc571f-f0fb-4aed-8b64-3999e63c1f19","resolution":{"observed_at":"2026-05-20T04:53:05.074152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.22896","last_updated":"2026-05-21T15:24:21Z","snapshot_observed_at":"2026-08-13T09:07:11.818716Z","submitted_at":"2026-05-21T15:24:21Z","title":"Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T05:49:15.137844Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.22896"},"observation_digest":"sha256:519225ef0d2047ca379be926ffa291e6dec8ce6e1736b82d70edb89f2350e29c","observation_id":"91e39c76-f4ea-45cf-a5ee-df5d0d8dc74b","resolution":{"observed_at":"2026-05-25T05:50:23.587617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.25477","last_updated":"2026-05-25T06:31:03Z","snapshot_observed_at":"2026-08-13T12:07:24.883855Z","submitted_at":"2026-05-25T06:31:03Z","title":"EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T22:10:08.682307Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.25477"},"observation_digest":"sha256:c0a9018df7c303c8f2b2ef696468f4ebfddf0fa17e994dacf91aa00282b774ce","observation_id":"1bf0a3ca-a72f-461b-b323-7cab20d2cdbf","resolution":{"observed_at":"2026-06-29T22:13:59.923584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-06T13:00:03.980604Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:79d67587321f6317128c33ea0eb057c1dae880f3c65fc9ffc900558491b581fc","observation_id":"df1dc87e-2b68-453a-aad5-bb4965f5b013","resolution":{"observed_at":"2026-06-29T19:53:55.988110Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.27491","last_updated":"2026-05-26T16:23:05Z","snapshot_observed_at":"2026-08-12T23:08:34.481586Z","submitted_at":"2026-05-26T16:23:05Z","title":"GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T17:22:40.258560Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.27491"},"observation_digest":"sha256:d0a70f496aaa6d508d85670bcffd5b2e753cae4b2abacf284dbd26606bfd5073","observation_id":"a706de2b-40e4-4b2d-851f-ec8ccd2fd7f5","resolution":{"observed_at":"2026-06-29T17:23:44.482736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.02313","last_updated":"2026-06-01T14:31:35Z","snapshot_observed_at":"2026-08-06T08:39:50.187649Z","submitted_at":"2026-06-01T14:31:35Z","title":"Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T14:28:23.759920Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.02313"},"observation_digest":"sha256:571a33b31c0cf89187dcded9637829c6997cdc9b4d4767e5ac16ea846ed0ebdc","observation_id":"92fe4348-2f02-45b6-bdcf-6a76e2e55036","resolution":{"observed_at":"2026-07-01T23:16:24.703428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.05468","last_updated":"2026-06-03T21:47:43Z","snapshot_observed_at":"2026-07-06T23:45:28.379468Z","submitted_at":"2026-06-03T21:47:43Z","title":"FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T05:38:11.089753Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.05468"},"observation_digest":"sha256:a9ab7377792c34e3a7dabdb93e876e810759dd1bf73a8c0b63e8ec3b170e34eb","observation_id":"66141af6-a326-4bb8-94bc-a52f2edd3006","resolution":{"observed_at":"2026-07-02T09:06:49.369951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.10927","last_updated":"2026-06-09T14:35:53Z","snapshot_observed_at":"2026-08-01T15:29:53.973770Z","submitted_at":"2026-06-09T14:35:53Z","title":"AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T13:25:59.194721Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.10927"},"observation_digest":"sha256:a7befe05ae532e378b65c1cf461c0edba36bf9c9df48f92a5b6221e0521c3c9f","observation_id":"ecdabe67-1554-4e5e-a184-d74d9e48a83c","resolution":{"observed_at":"2026-07-03T05:07:39.010306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.12109","last_updated":"2026-07-28T15:33:03Z","snapshot_observed_at":"2026-08-07T06:20:46.103025Z","submitted_at":"2026-06-10T14:03:52Z","title":"InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T09:24:25.659815Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.12109"},"observation_digest":"sha256:69f7962d5c1f3c5620da991eece44451f1f49fc5bc33ad3871d81f1a3692fbd3","observation_id":"3cdf9c80-2550-4181-8045-1642bba7be43","resolution":{"observed_at":"2026-07-03T11:38:05.561555Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-02T11:49:12.610001Z","title":"arXiv preprint arXiv:2505.18719 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.12109","last_updated":"2026-07-28T15:33:03Z","snapshot_observed_at":"2026-08-07T06:20:46.103025Z","submitted_at":"2026-06-10T14:03:52Z","title":"InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T11:49:12.610001Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.12109"},"observation_digest":"sha256:1ad1b41b284d64a39af578ab40e8e2c3ce404c5dab80535b8eeedadd1763d928","observation_id":"18b9c67c-fb9d-4a1a-b5d9-c3fe6e0e6c8d","resolution":{"observed_at":"2026-08-02T11:49:12.610001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.22540","last_updated":"2026-06-25T01:18:44Z","snapshot_observed_at":"2026-07-06T23:57:23.574340Z","submitted_at":"2026-06-21T14:54:07Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T10:27:00.283283Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.22540"},"observation_digest":"sha256:39469d18b325ce90cd25ca45c78e33aae25a9271ec8ea90ca94ae233963f76b8","observation_id":"2d07dac2-23cd-4b0f-91d8-0c274b787cab","resolution":{"observed_at":"2026-07-04T09:09:43.337115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.23623","last_updated":"2026-06-22T17:19:03Z","snapshot_observed_at":"2026-08-07T20:33:05.227708Z","submitted_at":"2026-06-22T17:19:03Z","title":"dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T08:11:41.429127Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.23623"},"observation_digest":"sha256:599a62b6169cd5f3994896d7bd3a53bee192a081aef30babed920fe32182f74e","observation_id":"80944bba-9465-4222-b737-d8dd66f6f9b4","resolution":{"observed_at":"2026-07-04T10:59:46.958851Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:ae447da87eeb7c38f0e0dbb2222852ee33bed900ae99fa5efb9191772757d11c","observation_id":"be122517-b9fc-41a9-9dc5-df9c8dc11f55","resolution":{"observed_at":"2026-07-04T09:59:44.633156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.26006","last_updated":"2026-06-24T16:23:18Z","snapshot_observed_at":"2026-07-07T00:00:21.918469Z","submitted_at":"2026-06-24T16:23:18Z","title":"FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-25T19:29:00.117285Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.26006"},"observation_digest":"sha256:115415934ca15e9972cea68b25aaf72d3a603de0cb88e141ca90cd6e973658a0","observation_id":"bcb2f0f8-2372-46da-896c-f3e0b99b4b0a","resolution":{"observed_at":"2026-07-04T20:50:12.338112Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.29892","last_updated":"2026-06-29T07:31:41Z","snapshot_observed_at":"2026-08-02T16:37:27.749603Z","submitted_at":"2026-06-29T07:31:41Z","title":"Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T06:02:15.781538Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.29892"},"observation_digest":"sha256:f82508c1498d2ba797b4c0c63c0ce701368d9015211651c6e69f2f7bcc668117","observation_id":"f10a5cd0-a4f3-4e14-9f7c-ce946f10cd2a","resolution":{"observed_at":"2026-06-30T06:04:21.080240Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2606.31958","last_updated":"2026-06-30T17:00:33Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:00:33Z","title":"Adapting Generalist Robot Policies with Semantic Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T05:09:29.625066Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2606.31958"},"observation_digest":"sha256:ac495995431ded9e49467e81fd0353ade70354f24a3ee2f685553eefd755d97f","observation_id":"f4a4d3aa-fc04-48bf-968a-5a2ff7b39904","resolution":{"observed_at":"2026-07-01T10:45:42.701388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2607.02431","last_updated":"2026-07-02T17:00:37Z","snapshot_observed_at":"2026-07-07T00:07:52.110955Z","submitted_at":"2026-07-02T17:00:37Z","title":"WorldSample: Closed-loop Real-robot RL with World Modelling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T10:57:40.128651Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2607.02431"},"observation_digest":"sha256:fab45f8443eca27ee993a8e593d87e24401d2d196b418fc79a1bc71127326dbd","observation_id":"c01e0230-32b9-4630-abe2-a37dba55aa79","resolution":{"observed_at":"2026-07-03T10:58:02.484283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-11T20:32:22.412216Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04265","last_updated":"2026-07-05T12:24:14Z","snapshot_observed_at":"2026-08-13T00:19:28.599201Z","submitted_at":"2026-07-05T12:24:14Z","title":"HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T20:32:22.412216Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2607.04265"},"observation_digest":"sha256:f46b3279989b870380fa9c1d31eb1f105d17120b2d7aa706c9f5ad146bca82c1","observation_id":"4fab7b81-c372-41c5-bab5-ab5298d2d764","resolution":{"observed_at":"2026-07-11T20:32:22.412216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2607.06706","last_updated":"2026-07-07T18:24:09Z","snapshot_observed_at":"2026-08-02T10:54:41.846058Z","submitted_at":"2026-07-07T18:24:09Z","title":"Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-10T23:01:01.563768Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2607.06706"},"observation_digest":"sha256:57976131255a1bd5a4c2fe7557b28df907b90ff7de2ed4ced88dca720db7be57","observation_id":"09598840-1f7d-4b8a-afd5-42772da2949b","resolution":{"observed_at":"2026-07-10T23:07:47.946348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-13T06:21:42.026251Z","title":"arXiv preprint arXiv:2505.18719 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08837","last_updated":"2026-08-12T00:00:42Z","snapshot_observed_at":"2026-08-13T12:26:17.408769Z","submitted_at":"2026-07-09T18:00:24Z","title":"Prompt-Driven Exploration","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-13T06:21:42.026251Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2607.08837"},"observation_digest":"sha256:7f9d8eab3077f4596fa8f88601ac6fc12601792ae66a05ed0d116282f74345da","observation_id":"1c410481-3d33-49ef-979f-45376a425704","resolution":{"observed_at":"2026-07-13T06:21:42.026251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-01T14:39:39.365484Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-08T18:57:26.098275Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:39.365484Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:9574f9c34dbed7b170cda5621302035c481169e6e84a9ab758c6cce0f4177368","observation_id":"379bb78a-3c73-4c7c-a487-415db58728cb","resolution":{"observed_at":"2026-08-01T14:39:39.365484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-30T12:43:44.568407Z","title":"VLA-RL: Towards masterful and general robotic manipulation with scalable reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23782","last_updated":"2026-07-26T17:58:47Z","snapshot_observed_at":"2026-08-05T21:21:45.801676Z","submitted_at":"2026-07-26T17:58:47Z","title":"$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-30T12:43:44.568407Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2607.23782"},"observation_digest":"sha256:53e60ae7581029e3bf9f79470e1f5d8d48bef4f4f29b5fca0662514ac98a4588","observation_id":"1a3c64a7-deb3-48fc-93ae-938cf8fcc637","resolution":{"observed_at":"2026-07-30T12:43:44.568407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-01T01:32:24.481776Z","title":"Vla-rl: Towards masterful and general robotic manipulation with scalable reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27782","last_updated":"2026-07-30T07:14:39Z","snapshot_observed_at":"2026-08-07T16:30:55.760479Z","submitted_at":"2026-07-30T07:14:39Z","title":"RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T01:32:24.481776Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2607.27782"},"observation_digest":"sha256:dd29eefb393f7e575f8ea3cff05112d66103f2c8e33b9d968ec6bb44d26be5e7","observation_id":"01bf5c1e-2ec4-4feb-ab87-83801cc30ddb","resolution":{"observed_at":"2026-08-01T01:32:24.481776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-03T03:34:03.842090Z","title":"Vla-rl: Towards masterful and general robotic manipulation with scalable reinforcement learning.arXiv preprint arXiv:2505.18719, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-11T07:42:17.033745Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.842090Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:11f98c425551da223b956127504d62690dc9102b2cccd7d24d793ef81d816972","observation_id":"123f041f-05e5-42a0-9235-954ec290d52b","resolution":{"observed_at":"2026-08-03T03:34:03.842090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-06T14:54:47.953372Z","title":"Vla-rl: Towards masterful and general robotic manipulation with scalable reinforce- ment learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04854","last_updated":"2026-08-05T13:47:59Z","snapshot_observed_at":"2026-08-11T01:54:15.111239Z","submitted_at":"2026-08-05T13:47:59Z","title":"Transforming Remanufacturing Automation with Large Language Models: A Forward-Looking Analysis with Case Studies","version":1},"reference_index":176,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:47.953372Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2608.04854"},"observation_digest":"sha256:8a165c9875f3e35fc531185ec00d9df89937aa19afcc38ae01f66b9289338e83","observation_id":"884978f0-2f9c-4d2f-8b90-121652174f19","resolution":{"observed_at":"2026-08-06T14:54:47.953372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-07T19:38:41.738287Z","title":"Ma, Y.; Song, Z.; Zhuang, Y.; Hao, J.; and King, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05999","last_updated":"2026-08-06T13:07:56Z","snapshot_observed_at":"2026-08-13T08:22:20.648035Z","submitted_at":"2026-08-06T13:07:56Z","title":"Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T19:38:41.738287Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2608.05999"},"observation_digest":"sha256:0b6d172ef18cecc1f2375e4df204291101b0b28ed6128c9f5963a257d2c815f9","observation_id":"9ce8dffa-5f44-4db6-91e5-24620bba3f4c","resolution":{"observed_at":"2026-08-07T19:38:41.738287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-10T10:29:55.257629Z","title":"VLA-RL: Towards masterful and general robotic manipulation with scalable reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07314","last_updated":"2026-08-07T15:09:51Z","snapshot_observed_at":"2026-08-12T23:12:46.020166Z","submitted_at":"2026-08-07T15:09:51Z","title":"TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T10:29:55.257629Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2608.07314"},"observation_digest":"sha256:aecd3e789bca430d8a05329f31e7c8d2d04d61a4d74cc2569c10b5e2606918d7","observation_id":"5476859f-65e1-4d2b-adcf-a043a72076f6","resolution":{"observed_at":"2026-08-10T10:29:55.257629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-11T00:35:34.159303Z","title":"arXiv preprint arXiv:2505.18719 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07596","last_updated":"2026-08-06T08:12:32Z","snapshot_observed_at":"2026-08-13T12:11:04.360971Z","submitted_at":"2026-08-06T08:12:32Z","title":"LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T00:35:34.159303Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2608.07596"},"observation_digest":"sha256:5df9b1015af99ca84055a06776076a19f31fefd702b69ce994e1032715bbddd4","observation_id":"e1a778d8-91c5-41fb-b680-01ea895e6215","resolution":{"observed_at":"2026-08-11T00:35:34.159303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-11T11:20:19.953071Z","title":"Vla-rl: Towards masterful and general robotic ma- nipulation with scalable reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09762","last_updated":"2026-08-10T15:54:25Z","snapshot_observed_at":"2026-08-13T12:18:43.528363Z","submitted_at":"2026-08-10T15:54:25Z","title":"Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:20:19.953071Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2608.09762"},"observation_digest":"sha256:de8b43a581651de77b7b5794e1bfcc7e4b276313cb90b538695f52364e166ab8","observation_id":"8fe47e55-fee9-49fc-b126-586f27ee244d","resolution":{"observed_at":"2026-08-11T11:20:19.953071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18719/citation-record","integrity":"/paper/2505.18719/integrity","json":"/paper/2505.18719/citation-record.json","paper":"/paper/2505.18719"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Advances in Neural Information Processing Systems (NeurIPS) 35, 28955–28971 (2022) 2, 3","venue":null,"work_id":"2b02057e-69a9-41d7-91b4-09a4ee4adf92","year":2022},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:f387f443ec587278939cbec74d5c06dc6a580bd8f9e510b0038b30bf8e5e9acf","observation_id":"e8897ecc-c9fe-4353-b0c2-e1ca2f27f787","resolution":{"observed_at":"2026-05-16T12:55:40.568547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07113","last_updated":"2019-10-16T00:59:05Z","snapshot_observed_at":"2026-08-02T15:37:37.200292Z","submitted_at":"2019-10-16T00:59:05Z","title":"Solving Rubik's Cube with a Robot Hand","version":1},"cited_work":{"arxiv_id":"1910.07113","doi":"10.48550/arxiv.1910.07113","metadata_source":"pith","pith_arxiv_id":"1910.07113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving Rubik's Cube with a Robot Hand","venue":"cs.LG","work_id":"81bf9cee-6de8-49f6-b967-3cb853e5ba67","year":2019},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/1910.07113","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:4a70d77a7762903534b20a769bd67ea8a1b0e1470ee68979844f8c73d18873a3","observation_id":"56b70fc8-9dba-4266-a090-169ef29283f6","resolution":{"observed_at":"2026-05-16T12:55:40.301555Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-22T19:53:19.266123+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T19:53:19.266123+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-12T14:22:37.782293Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14231","doi":"10.48550/arxiv.2505.14231","metadata_source":"pith","pith_arxiv_id":"2505.14231","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Univg- r1: Reasoning guided universal visual grounding with re- inforcement learning.arXiv preprint arXiv:2505.14231","venue":"cs.CV","work_id":"fad4943c-f29d-4daa-a7ba-dd6f03aac5aa","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2505.14231","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:b35ab24a5f22041f3b9474130afd7b4d226a0013be93a25a2fba4899f220b151","observation_id":"65cd68cd-285e-4905-b6dc-0168a44eaf42","resolution":{"observed_at":"2026-05-16T12:55:40.416599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Advances in Neural Information Processing Systems (NeurIPS) 35, 24639– 24654 (2022) 2","venue":null,"work_id":"f271101d-b0ac-4f48-8199-518a4806ce5f","year":2022},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:8480ec18494e137f3d95538b6eb149b37dc445cd4953e3a771dba3b394f63d63","observation_id":"2f726f0a-cc06-4494-83a9-41e35d7c33c7","resolution":{"observed_at":"2026-05-16T12:55:40.514953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of International Conference on Machine Learning (ICML)","venue":null,"work_id":"1973ad0d-d7fd-440f-b9b7-60d76e4519de","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:d77ed064de9e348644138d88d140cd0e5c682e898f4b4f027fb050cffe20e9d2","observation_id":"000b23d9-71fb-41b0-aa58-17f0b8ba2a7b","resolution":{"observed_at":"2026-05-16T12:55:40.517264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01918","last_updated":"2023-09-05T03:14:39Z","snapshot_observed_at":"2026-08-13T10:20:26.355858Z","submitted_at":"2023-09-05T03:14:39Z","title":"RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action Chunking","version":1},"cited_work":{"arxiv_id":"2309.01918","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.01918","snapshot_observed_at":"2026-07-04T04:09:35.398816Z","title":"arXiv preprint arXiv:2309.01918 (2023) 1, 2","venue":null,"work_id":"e2d9c6d8-696d-41ac-9192-932c001b1b2c","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2309.01918","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:bf70dd3bbdb02a6a3c1c2cfcb60ecdacf18f24c0ce3fd7964ba15e68688a4754","observation_id":"f080fb3e-2d6b-4701-833f-e05abeecf988","resolution":{"observed_at":"2026-05-16T12:55:40.445323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:32bfde1518f79d5ed71762bbd283b2b03639f165a16145ccf2bb8fffdc797ac3","observation_id":"9c09501f-ec09-4c2e-98d7-99374eb8f6ef","resolution":{"observed_at":"2026-05-16T12:55:40.480291Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:283b3536ca3db8dd925c0e70a963907308c6139f8aa20b2f625c9e66a6656655","observation_id":"9ec798c0-283b-47df-b3c8-0e7e80bd1c3b","resolution":{"observed_at":"2026-05-16T12:55:40.502751Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:9f723631014b7e60afd597f0140fc6847967433563ac29921bbab76c49ebb904","observation_id":"a4e64950-9ae9-4a71-9e69-3c85ea6ff1da","resolution":{"observed_at":"2026-05-16T12:55:40.293360Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robotics: Science and Systems (RSS) (2019) 1","venue":null,"work_id":"09e6e1ba-2417-4c86-934f-782e177bcc94","year":2019},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:eb8d104b68e0e7d971c0ceeb76719387994a3d8c3b8e886e2792e93f728c4558","observation_id":"1be0b055-e4c2-41ca-adeb-951803cab502","resolution":{"observed_at":"2026-05-16T12:55:40.519543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-08-07T09:11:20.723647Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"cited_work":{"arxiv_id":"2106.01345","doi":"10.3390/electronics12041051","metadata_source":"pith","pith_arxiv_id":"2106.01345","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","venue":"cs.LG","work_id":"a0295445-c5e8-43f7-95e4-eec56e7c0d07","year":2021},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2106.01345","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:a3b752c5205bb061af8ddd0d688016c8b1cd49bb5329a66c681efe2f625bd0f0","observation_id":"546bf604-9055-4f27-8156-51f3e9f9c62e","resolution":{"observed_at":"2026-05-18T15:11:11.482497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Robotics: Science and Systems (RSS) (2023) 6, 8","venue":null,"work_id":"6e05168f-523e-4bfb-8fc3-4922d1bccd8c","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:1de79f3c086c52f0326f3a22354b7690d031109d5d5cd9fb0507947a9ce420ef","observation_id":"5363b06a-3865-41b1-89ea-7cb6aee83657","resolution":{"observed_at":"2026-05-16T12:55:40.521746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":"1706.03741","doi":"10.48550/arxiv.1706.03741","metadata_source":"pith","pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep reinforcement learning from human preferences","venue":"stat.ML","work_id":"95b596b9-4880-42ad-ac79-570a3a8a9dee","year":2017},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:55edbd5a04621862ed551c4f4a61be17ec6d514435d06edf355476cba552ab10","observation_id":"93cd170a-7594-482b-8d1a-2c81f8397aff","resolution":{"observed_at":"2026-05-16T12:55:40.427495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:06cf3d95489124f21d1470ea5b7409ebf52da93be898e2f6f185cad4356fc184","observation_id":"2f947a66-9d89-4f63-8508-05c68e9a5cdb","resolution":{"observed_at":"2026-05-16T12:55:40.434915Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-11T05:34:32.208314Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:9315fa9539dc0907260a8710ecc7e4bf221275e9441e133ba3674e7e3a05a459","observation_id":"9e7467a3-69f1-4132-922a-7909a5721cc9","resolution":{"observed_at":"2026-05-16T12:55:40.441396Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conference on Robot Learning (CoRL) (2019) 1, 2 10","venue":null,"work_id":"a6c98747-5a3a-4937-8660-ef08cf121832","year":2019},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:7de4f38d676d4201347e1f31574007258d9dfd2d4ca1f4a6de173447f7e0f9c4","observation_id":"92c24dfe-4132-4d8f-a1d8-ea6fe01d1f10","resolution":{"observed_at":"2026-05-16T12:55:40.524136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:2d520bd3a4c60b09b1e336a331f8f5799f00d8421476857bd45166b75a479caf","observation_id":"2a8d5f44-a3b2-476a-a574-038b0f04644e","resolution":{"observed_at":"2026-05-16T12:55:40.457595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":"2109.13396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-07-04T08:49:42.858933Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","venue":"cs.RO","work_id":"59e728c0-b6ca-4759-a8f4-02b981f2220f","year":2021},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:d478d0798eb3e8d3270ebac18182574eb58f7b070bfb24c1a5658dcc2f92a255","observation_id":"9b21c88b-5944-48af-854a-7c81a2b98ef3","resolution":{"observed_at":"2026-05-16T12:55:40.461024Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02976","last_updated":"2024-08-07T18:11:51Z","snapshot_observed_at":"2026-08-13T05:09:18.001450Z","submitted_at":"2023-12-05T18:59:45Z","title":"SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real World","version":2},"cited_work":{"arxiv_id":"2312.02976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02976","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoc: Imitating shortest paths in simulation enables effective navigation and manipulation in the real world","venue":null,"work_id":"34709187-6f09-45cf-be99-3ac5e764151c","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2312.02976","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:2f9e9f1fc29f6d81ad0d0dcf029dae65005c52dc6f15afb0fd3f11b75a6d94ed","observation_id":"068f2bd5-b33c-431c-b3e7-629093b2e17c","resolution":{"observed_at":"2026-05-16T12:55:40.474285Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards Generalist Robots: Learning Paradigms for Scalable Skill Acquisition@ CoRL2023 3, 5 (2023) 1, 2","venue":null,"work_id":"55ef22e3-8657-467d-9af7-02e86e0648f5","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:56dd76d8cdeb4194b20fe9a42ff65c40c0b9856d3f89ab5f6aba6dac1cc9f618","observation_id":"ba63a9c8-4805-48e9-8c53-c3d903a0566f","resolution":{"observed_at":"2026-05-16T12:55:40.526505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":"2308.08998","doi":"10.1126/sciadv.abg6611","metadata_source":"pith","pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforced Self-Training (ReST) for Language Modeling","venue":"cs.CL","work_id":"db054f5c-62a3-405b-aae8-43e02c39f672","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:31de1e35e862d2875b0fef8a769f1550e8fc925fb47858eeb17510b83349318b","observation_id":"cb18c020-6a25-4f94-adda-3ad3544938d2","resolution":{"observed_at":"2026-05-16T12:55:40.483624Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16664","last_updated":"2025-01-28T02:53:48Z","snapshot_observed_at":"2026-08-13T09:27:30.536096Z","submitted_at":"2025-01-28T02:53:48Z","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2501.16664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16664","snapshot_observed_at":"2026-07-04T09:59:44.548397Z","title":"Improving vision-language-action model with online reinforcement learning.arXiv preprint arXiv:2501.16664","venue":null,"work_id":"f3f8e284-c68f-4d3f-aea0-68de9a3f8655","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2501.16664","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:2cf2423a4fcbe639f8d0b9493d8c6454a8dc3182766acd2af6c4d556d749451a","observation_id":"7108ed8c-d69a-4c54-b1fd-20506952726b","resolution":{"observed_at":"2026-05-16T12:55:40.499761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Advances in Neural Information Processing Systems (NeurIPS) 31 (2018) 1","venue":null,"work_id":"5a3bce56-838a-43a5-b26d-5cd0a041a3e1","year":2018},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:a268a05b123b6cd11b6b6955b02f5e0bfd60718cd877cc2e93d937b85505ced6","observation_id":"ae54093c-6909-4779-8fac-a860755b5a7d","resolution":{"observed_at":"2026-05-16T12:55:40.528816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conference on Robot Learning (CoRL) (2019) 2, 3","venue":null,"work_id":"3590a372-e6bb-44e2-a6dd-c2c15c7b1d4f","year":2019},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:ee9588eac09781c7832183e68c9f678f292871c62fcff09a96aa0bf116361084","observation_id":"1499b096-973f-44ef-8e18-4e3ffc4627d9","resolution":{"observed_at":"2026-05-16T12:55:40.531194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of AAAI Conference on Artificial Intelligence (AAAI) (2018) 2","venue":null,"work_id":"b3d28b4b-5a79-45ec-bb4a-9f5973a98d10","year":2018},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:09e8cfb2e562c2afc0e9a7934e41646f6cd5cacf78cab83d51055267b49ce0a2","observation_id":"106e4186-f838-4e66-b32c-d72c37862c1f","resolution":{"observed_at":"2026-05-16T12:55:40.533587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of International Conference on Learning Representations (ICLR) 1(2), 3 (2022) 5","venue":null,"work_id":"b19c469e-ba9b-4be1-932b-fc51d8a6dad6","year":2022},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:9f8b0bbef208776a793f7890a7e0535796c84b84beb966a8d430f0ad34dce7bd","observation_id":"3824aa91-1593-4173-8e66-23ded22612f4","resolution":{"observed_at":"2026-05-16T12:55:40.536376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-13T05:33:10.798511Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2311.02198","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-07-03T10:58:02.715158Z","title":"Imitation bootstrapped reinforcement learn- ing.arXiv preprint arXiv:2311.02198","venue":null,"work_id":"a3617785-a57a-4ba3-af3b-a179f510bfea","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:9a5b4ff665865eeb2d54fb9446bbaec35cb4a041e641b907d9354961161ab239","observation_id":"339b6e10-176d-4ec9-9ae2-d97fa84c9ee7","resolution":{"observed_at":"2026-05-16T12:55:40.322580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16578","last_updated":"2024-09-30T21:40:17Z","snapshot_observed_at":"2026-08-13T08:05:55.947632Z","submitted_at":"2024-09-25T03:15:17Z","title":"FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2409.16578","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.16578","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flare: Achieving masterful and adaptive robot policies with large-scale reinforcement learning fine-tuning","venue":null,"work_id":"becf872d-00df-41da-9286-d70b9a108de2","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2409.16578","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:a01401c734979e07a60000b28b3ff48778751dcf633c71f775aa1c9ea0b555b5","observation_id":"ddc4c65d-dd76-4906-8d39-cd67b10ed9b8","resolution":{"observed_at":"2026-05-16T12:55:40.331583Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04866","last_updated":"2023-09-28T16:17:08Z","snapshot_observed_at":"2026-08-13T11:48:58.313825Z","submitted_at":"2023-05-04T23:23:47Z","title":"Causal Policy Gradient for Whole-Body Mobile Manipulation","version":4},"cited_work":{"arxiv_id":"2305.04866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.04866","snapshot_observed_at":"2026-07-04T19:20:05.963419Z","title":"Causal policy gradient for whole-body mobile manipulation","venue":null,"work_id":"ebed4542-5f92-4a30-9b65-1ea8535d5d90","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2305.04866","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:039a4b617a3dc3719296f2092fdcba219f926b6dceaaf5f4c6a50957df20b3d7","observation_id":"61e0752e-fcb9-4129-bfa0-6a5bc4c7d35a","resolution":{"observed_at":"2026-05-16T12:55:40.380217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-12T12:08:23.520312Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":"2405.11143","doi":"10.48550/arxiv.2405.11143","metadata_source":"pith","pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","venue":"cs.AI","work_id":"70fa48c9-2f84-49f6-9aca-37476e021fc3","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:c9b6741f4cc5f71910f1485df8826677215b04d89d1b5b3a373c4285ebcf9f47","observation_id":"2e95b3cc-a89f-4026-a3f7-b425f06e79ad","resolution":{"observed_at":"2026-05-16T12:55:40.387001Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:ff4f8b7bb5311ce1757a4e2aace68ef58e31bc31569a836b678a402f0fd6796e","observation_id":"ac38b858-7daa-4825-a3ab-1555b7dfe533","resolution":{"observed_at":"2026-05-16T12:55:40.409260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:3cc6317369695af347e32f6a97cd372a9781681f10055965e33c5948e1571f64","observation_id":"45587987-2e58-4c9b-ba7f-001bd17d22eb","resolution":{"observed_at":"2026-05-16T12:55:40.412498Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Conference on Robot Learning (CoRL)","venue":null,"work_id":"7e8f141b-0518-4a39-a4a5-1ab2163ded0f","year":2022},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:f50cf8e983a0494953db9d254799c64963bc447b41fcae2abefc3ccb3348787b","observation_id":"2602e46e-fc63-4d1c-b56b-703d9047ff93","resolution":{"observed_at":"2026-05-16T12:55:40.539654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10190","last_updated":"2020-07-31T13:43:53Z","snapshot_observed_at":"2026-08-09T16:21:48.976373Z","submitted_at":"2020-04-21T17:57:04Z","title":"Never Stop Learning: The Effectiveness of Fine-Tuning in Robotic Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2004.10190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.10190","snapshot_observed_at":"2026-07-04T08:29:41.688986Z","title":"Never stop learning: The effectiveness of fine-tuning in robotic reinforcement learning","venue":null,"work_id":"9e9883b4-bd48-4981-9bf1-798b3e831692","year":2004},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2004.10190","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:29c6532e51c42a5a6923e18a58d013c3cc808041e29fa7496254778b99758bc4","observation_id":"64091f06-2072-49fe-9128-d1612f70ffca","resolution":{"observed_at":"2026-05-16T12:55:40.420276Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.10293","last_updated":"2018-11-28T02:40:54Z","snapshot_observed_at":"2026-08-02T20:30:39.614115Z","submitted_at":"2018-06-27T04:34:30Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"1806.10293","doi":"10.48550/arxiv.1806.10293","metadata_source":"pith","pith_arxiv_id":"1806.10293","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","venue":"cs.LG","work_id":"9a64fd9b-aa3d-48af-ac99-b368b857a6e0","year":2018},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/1806.10293","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:99e3dbd5f1d6112f2d451a6b729e9f84e2b893266c1035c9ebefb11fa0592244","observation_id":"897fa41e-adc0-437e-9c31-68dfd8d45e93","resolution":{"observed_at":"2026-05-16T12:55:40.423602Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv (2021) 1, 2","venue":null,"work_id":"64c575b1-474d-4a41-962a-80ed70acd5f8","year":2021},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:1051882dca9ce765e16b0635d6016b62aac9d821176f8662bb20d96893ec5a76","observation_id":"67becbbb-e5c2-446a-b944-a51c50f7f95d","resolution":{"observed_at":"2026-05-16T12:55:40.542750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:863209d0e4f292150e51bc6152ca9fbcfbda0859fa9df18c17bb5c234166f199","observation_id":"5de4596b-0f31-4d6a-8b65-aed54bfc2bbf","resolution":{"observed_at":"2026-05-16T12:55:40.431541Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of Artificial Intelligence Research75, 1401–1476 (2022) 2","venue":null,"work_id":"86841891-b671-4f91-933a-56a8e6e9a319","year":2022},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:d7a8dbc2dd6e04ec2f271f6378a116902c50ef4b8247a57b7b7bddfe5b4daba5","observation_id":"da7d9ac1-268c-4c8c-b53c-ebd767ad9931","resolution":{"observed_at":"2026-05-16T12:55:40.546268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:0e638bc7797059d60b7add1b86406542e94248c0d743af40d62dfde66d34c1e5","observation_id":"e074ba19-1be5-41fc-8671-34b34d1ae0cd","resolution":{"observed_at":"2026-05-16T12:55:40.438028Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: From motor learning to interaction learning in robots, pp","venue":null,"work_id":"68abdde0-4f91-4043-8c5b-913b665bb2c1","year":2010},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:740bf186d83f73362257dc7be1d77cb9375021759fcd9d41b03ec0eac3bdda09","observation_id":"366f85c5-4aa2-4d73-883f-526c0384cc89","resolution":{"observed_at":"2026-05-16T12:55:40.550002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 29th Symposium on Operating Systems Principles","venue":null,"work_id":"a98d201a-18fd-4f3c-aeef-43e2e7acddf8","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:60fd09e1af52e188182b86d8664d89788afc286a24b444ff455e538aec3227b8","observation_id":"41d6a677-848d-4126-bad2-2904e7b2bd4c","resolution":{"observed_at":"2026-05-16T12:55:40.552954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:4f671281a46232e33e3e4908b9c53350be1ce0ae4daa89d562a62ce6ecec6343","observation_id":"1b63beae-a6c2-419b-a386-ed53dc42d81e","resolution":{"observed_at":"2026-05-16T12:55:40.448484Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:cabe3a624d8bda7f2f9e51a7f2bbfe46187b48761ace6d088a81fa5cb914c8ed","observation_id":"b73ccd39-c036-4e3c-9561-e58abe5d4ad1","resolution":{"observed_at":"2026-05-16T12:55:40.451426Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18647","last_updated":"2026-06-26T02:30:53Z","snapshot_observed_at":"2026-08-12T22:16:00.894762Z","submitted_at":"2024-10-24T11:19:30Z","title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation","version":4},"cited_work":{"arxiv_id":"2410.18647","doi":"10.48550/arxiv.2410.18647","metadata_source":"pith","pith_arxiv_id":"2410.18647","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Data scaling laws in im- itation learning for robotic manipulation","venue":"cs.RO","work_id":"7f726c47-5435-4bf1-82c7-d27a6dd714ea","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2410.18647","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:61333c2f014cd790a5421c7bcad425c9bd609bb7fd5a39e90eab2d8768346729","observation_id":"612a62ee-1087-47e0-9942-d071da7629f7","resolution":{"observed_at":"2026-06-29T02:14:00.368555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Advances in Neural Information Processing Systems (NeurIPS) 36 (2024) 2, 6","venue":null,"work_id":"1ad4ee21-2213-43af-be54-43294a164326","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:da0f658e5257b0eda7690744ee8f419a88fe60e0008efe08e3e4683588393371","observation_id":"41219db2-4d88-4017-b72a-a9c25cf6d625","resolution":{"observed_at":"2026-05-16T12:55:40.555326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of European Conference on Computer Vision (ECCV)","venue":null,"work_id":"8aaf3148-950a-4e5f-8a7a-55e900f5da9f","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:144ad8904e82d025a9c7bbe5bda808ff4c9ebac8be092eb8af002a111f74981e","observation_id":"6c2e92e3-1486-4928-bdfd-ef75be74d8c0","resolution":{"observed_at":"2026-05-16T12:55:40.557675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:993fb176e2c9c8f5389b0ef9fc82be9c2a9e4c24cc7fe9f21d89902364a9f321","observation_id":"d3fe87ec-04d6-4d2d-ac6c-958d11db9626","resolution":{"observed_at":"2026-05-16T12:55:40.464329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07062","last_updated":"2023-12-14T03:28:49Z","snapshot_observed_at":"2026-08-13T05:04:27.056618Z","submitted_at":"2023-12-12T08:30:09Z","title":"ThinkBot: Embodied Instruction Following with Thought Chain Reasoning","version":2},"cited_work":{"arxiv_id":"2312.07062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07062","snapshot_observed_at":"2026-07-03T17:18:44.029637Z","title":"Thinkbot: Embodied instruction following with thought chain reasoning","venue":null,"work_id":"97c67f58-dad6-4b6a-b8e6-ada30fe94fbc","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2312.07062","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:5ffd8dd4aaaae12db269a764587959872d87755acf6a4a3659beef0e53fedabc","observation_id":"cce31cc0-399a-4cbf-b173-dab8a235e16a","resolution":{"observed_at":"2026-05-16T12:55:40.467721Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05424","last_updated":"2021-11-11T16:41:53Z","snapshot_observed_at":"2026-07-06T12:07:02.414603Z","submitted_at":"2021-11-09T21:27:33Z","title":"AW-Opt: Learning Robotic Skills with Imitation and Reinforcement at Scale","version":2},"cited_work":{"arxiv_id":"2111.05424","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.05424","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2111.05424 (2021) 2","venue":null,"work_id":"4de22035-0bb9-4f56-bef9-9a3bd9cd3d29","year":2021},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2111.05424","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:29ae8c4d612b9c6bcd8f391d3c2c9efc2e7c8ca39c83bbec75778787ac4ce3cb","observation_id":"68a59a5d-e582-464c-87bf-7959dd378f3b","resolution":{"observed_at":"2026-05-16T12:55:40.471034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: IEEE International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":"0fcab65e-add0-4def-adb1-f1dc11d25e40","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:3b136f7a2456f8912dc8618a19dbd3a57333ddb050f2b0911619f218b07e99e0","observation_id":"b2a778f1-2dbb-4a81-bc48-586505eba148","resolution":{"observed_at":"2026-05-16T12:55:40.560500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21845","last_updated":"2025-03-20T09:16:05Z","snapshot_observed_at":"2026-08-13T05:50:00.588124Z","submitted_at":"2024-10-29T08:12:20Z","title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2410.21845","doi":"10.48550/arxiv.2410.21845","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21845","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Precise and dexterous robotic manipulation via human-in-the-loop reinforcement learning","venue":"arXiv (Cornell University)","work_id":"dc4109d9-11b9-4541-b20b-d3bbe03c7735","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2410.21845","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:944e61b257b79d4cd848d47523615ee81ecaa163554820da304a60762de43d78","observation_id":"77728afb-05ac-4ec6-ac06-10df5faab142","resolution":{"observed_at":"2026-05-16T12:55:40.477240Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Conference on Robot Learning (CoRL)","venue":null,"work_id":"a1b4971b-ab62-4f30-b42d-4558fe27355b","year":2018},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:fe6024232acf93b04a7278e2046ba98e66e809ac2830f62aadea741ae36fc0c9","observation_id":"c5c8edd8-14fb-461b-82fe-f6c95731e838","resolution":{"observed_at":"2026-05-16T12:55:40.563327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: 13th USENIX symposium on operating systems design and implementation (OSDI 18)","venue":null,"work_id":"0db3ec8e-2374-4769-86a6-ce0784359589","year":2018},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:2e05de25ec880c7e9b7b3e34c0c94d0ccedb67d30b1b621ff2793e07df38c48c","observation_id":"fdeb00cc-2067-4a65-a583-ffdbde5915f9","resolution":{"observed_at":"2026-05-16T12:55:40.566046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":"2006.09359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-07-08T22:35:40.693821Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","venue":"cs.LG","work_id":"f0a11265-1acf-4ffc-a822-08bd04b6bddf","year":2020},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:8a77dd96855f5421e8fd6d8c793e22ea4e7dc59d3fe3d1003240e85e4c37134b","observation_id":"9577ce28-66b3-4add-92d4-359e14dbd690","resolution":{"observed_at":"2026-05-16T12:55:40.486956Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:1369c073f622f8a6b0bae9ec34226ba78af7bf0f83431c6a39159011746990ad","observation_id":"d50dc313-3588-4bc8-ba8c-80acc68977f3","resolution":{"observed_at":"2026-05-16T12:55:40.490754Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:07b39f14362c7fcd59c1b7d9ccddddd542a73f79cb534697c3f6f7a54750759b","observation_id":"c8f2ce38-05c1-421a-98a7-203f9b9b970f","resolution":{"observed_at":"2026-05-16T12:55:40.493812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:15e1247200c052b9a3df13944baaa18c3909015244e5157044d3a66351737c15","observation_id":"6990683a-0047-4f84-bd40-d34b0f706960","resolution":{"observed_at":"2026-05-16T12:55:40.496669Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: IEEE International Conference on Robotics and Automation (ICRA)","venue":null,"work_id":"435ea0fe-5c86-4694-b500-254aee1f01fa","year":2016},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:14e17c316eeacc92d42a3f0236993aa5bc7f3f3fe9f023dab044e2411c21a8b7","observation_id":"c74546cd-dfe2-4a6e-8bf8-bc47efdae9bf","resolution":{"observed_at":"2026-05-16T12:55:40.512174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Advances in Neural Information Processing Systems (NeurIPS) (2023) 7","venue":null,"work_id":"86122039-8891-4c76-bb3c-f6386b6b5f1e","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:545f0c344c3e384021aadb2044e7eba0cf8bfa71e12bd1c05c2b31f26bef1e00","observation_id":"d9b6d6c2-4ff2-4387-b4e8-ac82a01c600e","resolution":{"observed_at":"2026-05-16T12:55:40.570595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-07-06T06:01:51.192687Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":"1709.10087","doi":"10.48550/arxiv.1709.10087","metadata_source":"pith","pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","venue":"cs.LG","work_id":"e0799bae-989e-4c06-891d-c93b0b32024d","year":2017},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:ae7cc518bd1ea9d3e1fa5c8e10284b44c3c0647932f114debb8b01c86382cc5e","observation_id":"07556621-1d89-42b3-9560-e09a19f183c9","resolution":{"observed_at":"2026-05-16T12:55:40.505914Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-12T21:29:36.308819Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:f5e6d84225b6def3ce11ef2eff9d3038782408875fda7deccce99cb44a40caa7","observation_id":"916f6c37-2c5a-4aed-835e-1b1828d8a4ed","resolution":{"observed_at":"2026-05-16T12:55:40.509461Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:dac31f821f4dbb74348741016d9a389a09dc14c60be3e95bb693a1082d2225ac","observation_id":"ab42983c-4248-4c9e-9466-bf77727e168f","resolution":{"observed_at":"2026-05-16T12:55:40.286333Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Google AI (2025) 1","venue":null,"work_id":"aa97ca16-5fab-4fef-9038-cd55f4c31622","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:b3c934a89617b05a1b60c7cbbc0d2e39cb857539737e092b2449b940b8f42b0d","observation_id":"a7a9c857-8ab5-48aa-bb77-f21c2f6cdb9e","resolution":{"observed_at":"2026-05-16T12:55:40.572632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:cad5d70ec025b2b7d75ee368d1f1ebc7bd900f9de47ad2d13d11303194e31c46","observation_id":"dcc32ed3-7850-4de0-8b33-3c4bf84624f3","resolution":{"observed_at":"2026-05-16T12:55:40.297746Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of International Conference on Learning Representations (ICLR) (2023) 2","venue":null,"work_id":"33db3d53-56ab-4c90-9604-3a49b79a9f89","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:7da0ff62c003fadcc0dbade2b5ed144c28b461c284f10eb5cbbf479768ec1236","observation_id":"bc646701-724d-4f42-a316-0d034691272b","resolution":{"observed_at":"2026-05-16T12:55:40.574726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03539","last_updated":"2024-09-16T15:41:05Z","snapshot_observed_at":"2026-08-12T23:07:29.809700Z","submitted_at":"2024-08-07T04:35:38Z","title":"Deep Reinforcement Learning for Robotics: A Survey of Real-World Successes","version":3},"cited_work":{"arxiv_id":"2408.03539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.03539","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2408.03539 (2024) 2","venue":null,"work_id":"e60b7581-8fb7-4759-9580-285bffc4c4fd","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2408.03539","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:628853ded13ca0ec9eea349b3702b8b72d75f2033079f792a38111b2d7c3d722","observation_id":"f71efbaf-08a7-48ce-99b5-42145d35d2c2","resolution":{"observed_at":"2026-05-16T12:55:40.305488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of Machine Learning Research (JMLR) 10(7) (2009) 2","venue":null,"work_id":"70d24c07-99bf-4ea4-83f9-589ea9bea493","year":2009},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:d298feae3b61eef9af7a1d6fd8778482bd00da7d7186d9cbe5f11b61a814f0b0","observation_id":"bdaa6fca-9357-476e-809a-981017fc675f","resolution":{"observed_at":"2026-05-16T12:55:40.577062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:15a798178f204f0e7e146ba0c9a865cb11b60669089d97fe15985ff8d40ac157","observation_id":"54d36f7c-67f4-4d00-998d-bb395c545405","resolution":{"observed_at":"2026-05-16T12:55:40.314752Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:4d150e43ae10138611071554b107b59efdd4eed07a05d7e6cbede2bc2887e507","observation_id":"d2bbe571-76eb-4455-be43-3dc21c6908be","resolution":{"observed_at":"2026-05-16T12:55:40.318456Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of International Conference on Machine Learning (ICML)","venue":null,"work_id":"fc913a8c-0f34-445c-a5ff-45a322839630","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:8af0b8638566049a0f68e4b752a1530933f0f454327024b9609a07e4dd083026","observation_id":"163e1871-2b92-4f73-b0fa-bee9785e5baa","resolution":{"observed_at":"2026-05-16T12:55:40.579446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-10T07:54:23.821978Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":"1707.08817","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-07-10T21:47:36.312721Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","venue":"cs.AI","work_id":"a4478529-fa6c-4c19-98bd-743c55919fd6","year":2017},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:920d615171b05ffe245c91910e4a04dec16f7e9f21be3cd0df23f2efb85fab5e","observation_id":"8dc8bca2-8309-4809-81fa-feaf670d7e7e","resolution":{"observed_at":"2026-05-16T12:55:40.327647Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b9c50226-7f3d-40b7-b911-73c73dd55622","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:7128d6355c59fc2e3d81610ac956c678ada217768d141ffdd52fde799e97d75e","observation_id":"90a8e952-af5c-459f-996b-d7390064a253","resolution":{"observed_at":"2026-05-16T12:55:40.581579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00603","last_updated":"2024-12-15T12:04:12Z","snapshot_observed_at":"2026-08-12T23:32:00.417126Z","submitted_at":"2024-06-30T06:08:12Z","title":"Hierarchical Memory for Long Video QA","version":2},"cited_work":{"arxiv_id":"2407.00603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00603","snapshot_observed_at":"2026-07-02T12:46:56.841222Z","title":"arXiv preprint arXiv:2407.00603 , year=","venue":null,"work_id":"4388f046-e6d0-4c8c-947f-158d36ae298a","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2407.00603","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:f5a6c7d4bb0c31661983078e5dc54278d931135d5d805bb392a33ed0d05b9e49","observation_id":"b41fad6c-2b33-46c5-81aa-f41d4b4846b9","resolution":{"observed_at":"2026-05-16T12:55:40.335129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01268","last_updated":"2024-12-02T08:35:31Z","snapshot_observed_at":"2026-08-13T12:34:53.689011Z","submitted_at":"2024-12-02T08:35:31Z","title":"Ponder & Press: Advancing Visual GUI Agent towards General Computer Control","version":1},"cited_work":{"arxiv_id":"2412.01268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01268","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.01268 (2024) 1","venue":null,"work_id":"b7af2b2d-35bd-4507-b0eb-aed79f5a29cb","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2412.01268","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:82b381fa27409dec29d4055e919046beacb24f7446aef7b681bea26927eb9cdd","observation_id":"23ab67ae-3c8f-4ce9-8b83-4fad3e7eb571","resolution":{"observed_at":"2026-05-16T12:55:40.338585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.20073","doi":"10.18653/v1/2025.acl-long.887","metadata_source":"pith","pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","venue":"cs.LG","work_id":"b96383ee-f8dc-471f-aba4-bc5ce9b0b632","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:568d5ef258449ad503478a8ca734998701202e5a75110c903804f2475291ca02","observation_id":"5ab7702e-0e98-4869-a4c7-6d183698e938","resolution":{"observed_at":"2026-05-16T12:55:40.342411Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02868","last_updated":"2024-07-17T09:29:19Z","snapshot_observed_at":"2026-08-13T04:26:55.794008Z","submitted_at":"2024-02-05T10:30:47Z","title":"Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation Problem","version":3},"cited_work":{"arxiv_id":"2402.02868","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.02868","snapshot_observed_at":"2026-07-04T03:59:32.981758Z","title":"arXiv preprint arXiv:2402.02868 , year=","venue":null,"work_id":"ea44575d-878a-442a-8dfe-91dd13f36245","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2402.02868","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:5a1b253fe5b5fe49cac12015c9b83726ee4e3ac6f8d62d20b912aa0401759447","observation_id":"57a908c9-f339-4412-9588-70200ab91d19","resolution":{"observed_at":"2026-05-16T12:55:40.348097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12203","last_updated":"2024-11-12T15:00:37Z","snapshot_observed_at":"2026-08-13T00:50:54.816048Z","submitted_at":"2024-03-18T19:25:57Z","title":"Bootstrapping Reinforcement Learning with Imitation for Vision-Based Agile Flight","version":3},"cited_work":{"arxiv_id":"2403.12203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12203","snapshot_observed_at":"2026-07-04T14:09:52.679620Z","title":"Bootstrap- ping reinforcement learning with imitation 10 for vision-based agile flight","venue":null,"work_id":"45bbf4ba-76ee-4349-a7ff-c00c1bcdc067","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2403.12203","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:772e256d374931bc3852d916c67187bfe52685312b9ee999a715ffc4f289d513","observation_id":"dfc0f75d-3459-4f9e-9f3c-2dd025d7d7a5","resolution":{"observed_at":"2026-05-16T12:55:40.353532Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09858","last_updated":"2024-12-13T04:57:55Z","snapshot_observed_at":"2026-08-12T08:38:59.964105Z","submitted_at":"2024-12-13T04:57:55Z","title":"RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2412.09858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09858","snapshot_observed_at":"2026-07-04T16:49:58.308235Z","title":"arXiv preprint arXiv:2412.09858 (2024) 9","venue":null,"work_id":"dc18ada4-64cb-4f30-bb77-9e188be519f2","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2412.09858","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:fec5989461a611cf6174b269b116625e2512ab7b7f498b121311f1e4834ee038","observation_id":"3364acc7-9aa7-4326-8492-fcdad8c6e926","resolution":{"observed_at":"2026-05-16T12:55:40.358784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:dfb6fa83e254a432c59ddd703bd0e39677e5e85639496529453f19e75699d875","observation_id":"4e11f906-e6ad-400f-ba18-078970dff357","resolution":{"observed_at":"2026-05-16T12:55:40.362546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00447","last_updated":"2024-11-30T11:42:35Z","snapshot_observed_at":"2026-08-13T02:51:35.396037Z","submitted_at":"2024-11-30T11:42:35Z","title":"ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models","version":1},"cited_work":{"arxiv_id":"2412.00447","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00447","snapshot_observed_at":"2026-06-29T21:13:59.795139Z","title":"Atp-llava: Adaptive token pruning for large vision language models","venue":null,"work_id":"570f19d0-0d55-428e-8a5c-bc458f6585f9","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2412.00447","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:9dcbe34dbe4d14b51576ead14cc83dfaaa7068d439798bdf5532c93f5cf38127","observation_id":"5f9f9108-cba8-4174-8c38-58b4ea014579","resolution":{"observed_at":"2026-05-16T12:55:40.366251Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-08-13T00:10:37.900129Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.12275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2406.12275 (2024) 1","venue":null,"work_id":"155a8d96-720e-4bca-a9ff-17138f39f883","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:ea13437e503ec3017cae3173e69d358b4d68542327153f30bf6a4395bc155bc9","observation_id":"949cbecf-4b31-44f1-933a-4ae41c6f8d5f","resolution":{"observed_at":"2026-05-16T12:55:40.369819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:158172339df24dd60fee1650b801e57fbe7ea7f594720ee04e10e488ae917645","observation_id":"ad890374-dd81-4fc5-9731-dd33c7d49399","resolution":{"observed_at":"2026-05-16T12:55:40.372850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-08-13T12:20:57.788212Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.01825","doi":"10.48550/arxiv.2308.01825","metadata_source":"pith","pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","venue":"cs.CL","work_id":"15eea2e2-dff3-42a7-842a-b663d50f64cb","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:46b8f27691c2ccf3b4165596a7a8468461dc244d06e3dcfb0e7da3982911dd50","observation_id":"9a5971cf-3333-4241-a5ac-91d801969469","resolution":{"observed_at":"2026-05-16T12:55:40.376599Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-22T08:24:16.697802+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T08:24:16.697802+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Advances in Neural Information Processing Systems (NeurIPS) 35, 15476– 15488 (2022) 3","venue":null,"work_id":"c3952a9b-5be2-43e0-850d-5d0e836863ef","year":2022},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:10915a142201f990bcbb520ccf7f765df73d85cf794f37f7217e91e4a7ebfa58","observation_id":"f808a29e-9e89-498a-903b-3865ee98f85a","resolution":{"observed_at":"2026-05-16T12:55:40.583767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20083","last_updated":"2024-06-28T17:51:10Z","snapshot_observed_at":"2026-08-12T23:32:43.637289Z","submitted_at":"2024-06-28T17:51:10Z","title":"PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators","version":1},"cited_work":{"arxiv_id":"2406.20083","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.20083","snapshot_observed_at":"2026-07-04T16:59:58.789222Z","title":"Poliformer: Scaling on-policy rl with transformers results in masterful navigators","venue":null,"work_id":"2a8fd599-9fee-4539-bdbb-35c2c82330be","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2406.20083","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:ad13435ec853197a540f8928350ef5bb54e3427298b011bc33ec5c4da2cf8bd9","observation_id":"4db77e89-7dfd-4933-9eca-fcb3fc8ac11c","resolution":{"observed_at":"2026-05-16T12:55:40.383944Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of International Conference on Computer Vision (ICCV)","venue":null,"work_id":"db1c487b-1360-49a4-b94f-074170a6f99c","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:a1eeb407f997912c7ab6f488f3b2eaa3c58257046ac3345f39ce239c19c5367e","observation_id":"43afe699-a7ef-47e6-8ac8-4502143488b1","resolution":{"observed_at":"2026-05-16T12:55:40.586037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-13T01:15:12.087659Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":"2406.08085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-07-04T20:00:08.182505Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":"f53e5fea-3444-480b-aa38-be98378c0ced","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:df568681aff4a951b55a0e5ca6fa820ba320205c8d644f56c3e1ec06176c9793","observation_id":"f614c2f9-c1ee-4bd9-92c9-241b1d2d38bb","resolution":{"observed_at":"2026-05-16T12:55:40.390683Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2501.07301","doi":"10.48550/arxiv.2501.07301","metadata_source":"pith","pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","venue":"cs.CL","work_id":"9ee77906-18e8-4356-a468-1d6f7e781977","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:345e5e1920ed419002dc9033e87a96d8250c73b02f619f99b54d6e0e46fd00ff","observation_id":"586d7973-c27e-45c9-82dd-b467357d334c","resolution":{"observed_at":"2026-05-16T13:43:43.298530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:47.370016+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:47.370016+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-08-12T11:14:32.128911Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:7f9266356cd846cf3403e309b7c30543ca6d392fbcd7f626e8d949dc0fd5e511","observation_id":"a50457bd-f4cd-4f9a-a775-a7e4dfb9c6c6","resolution":{"observed_at":"2026-05-16T12:55:40.398126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:5ee163d04ceb5d7ad9fe4328e8ed3a21eda142adfc2f5ce66d3c326ef2025f02","observation_id":"65a0e00b-9d5f-44d8-9679-92277947ce43","resolution":{"observed_at":"2026-05-16T12:55:40.402013Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12570","last_updated":"2020-04-27T03:36:10Z","snapshot_observed_at":"2026-08-09T09:30:54.167911Z","submitted_at":"2020-04-27T03:36:10Z","title":"The Ingredients of Real-World Robotic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2004.12570","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.12570","snapshot_observed_at":"2026-07-04T09:59:44.626163Z","title":"arXiv preprint arXiv:2004.12570 (2020) 2","venue":null,"work_id":"58233088-569f-42a2-bad2-8195f07616cc","year":2004},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2004.12570","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:a04d085b0df50b26890f13cc1f81fbeb58d3e99aa306ace608486d56969e60d2","observation_id":"7b83022a-a003-4080-a99f-2f33b4a44360","resolution":{"observed_at":"2026-05-16T12:55:40.405729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Robotics: Science and Systems (RSS) (2018) 2, 3","venue":null,"work_id":"2fd3449a-f3c4-4959-9a49-d3f2c2d36501","year":2018},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:3484387f53d9547b0e944367eb16e601877a14b351a0664ab5fbca41bb157e93","observation_id":"001293e4-1d88-448e-ae58-dfaf748352b1","resolution":{"observed_at":"2026-05-16T12:55:40.588575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions on Pattern Analysis and Machine Intelligence (TPAMI) (2023) 2 15","venue":null,"work_id":"7b83f6a5-fcf5-48d0-b430-6a543b1dda82","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:1b105f7e281a5fd5ea7aa966e2c661be4a308f99487c31d39084abdc0592db50","observation_id":"0632fdfa-b1ed-42bf-9b25-24c0441a7d65","resolution":{"observed_at":"2026-05-16T12:55:40.590806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":40,"parse_uncertain":0,"unresolved":1,"verified_exact":21,"verified_fuzzy":31},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 74 inbound Pith citation observations for arXiv:2505.18719."}