{"as_of":"2026-08-12T04:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f22c5eff6f2aa70aad4ae49e3ba57bd5b5a26f2e28aedd1db3f6092baeab2fdb","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:49:05.337733Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:34:04.267745Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T10:48:02.217286Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"cited_work":{"arxiv_id":"2602.12628","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12628","snapshot_observed_at":"2026-07-03T10:48:02.217286Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","venue":"cs.RO","work_id":"ac475801-57f5-4d37-8e62-9a8f4a46cdd4","year":2026},"citing_paper":{"arxiv_id":"2606.11743","last_updated":"2026-06-10T07:20:36Z","snapshot_observed_at":"2026-08-04T03:57:45.233984Z","submitted_at":"2026-06-10T07:20:36Z","title":"TacCoRL: Integrating Tactile Feedback into VLA via Simulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T09:51:56.563479Z"},"links":{"cited_paper":"/paper/2602.12628","citing_paper":"/paper/2606.11743"},"observation_digest":"sha256:d04c9ca86a4952b0008f51846d55f3703df6a9f032395a661897ccf0df697ca2","observation_id":"1c1286bd-3121-4389-8f5f-db24d60416a9","resolution":{"observed_at":"2026-07-03T10:48:02.218471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12628","snapshot_observed_at":"2026-08-03T03:34:04.267745Z","title":"Beyond imitation: Reinforcement learning-based sim-real co-training for vla models.arXiv preprint arXiv:2602.12628, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-11T07:42:17.033745Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.267745Z"},"links":{"cited_paper":"/paper/2602.12628","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:bb8f3b3fcb57a43c8695e8630b46130cf058db5cd3b5adf5ad7dcc0dc62828c3","observation_id":"592d2881-d740-4607-8194-2e85d338ba83","resolution":{"observed_at":"2026-08-03T03:34:04.267745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.12628/citation-record","integrity":"/paper/2602.12628/integrity","json":"/paper/2602.12628/citation-record.json","paper":"/paper/2602.12628"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:55.118801Z","title":"Learning dexterous in-hand manipula- tion.The International Journal of Robotics Research, 39 (1):3–20, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.118801Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:a69aff5df97beabd1fb100942d1b76e2e270181e7985479aad63e72c2effc8c3","observation_id":"bd3e8958-b588-4be5-9e15-d7b15b02246c","resolution":{"observed_at":"2026-08-02T23:48:55.118801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:55.210423Z","title":"From imitation to refinement- residual rl for precise assembly","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.210423Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:e0ce6644e37a6f5fb811d8d2c06410c82485609e6438d97cb666a90d718463f0","observation_id":"b96170df-287b-48cd-8f92-0872773422da","resolution":{"observed_at":"2026-08-02T23:48:55.210423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T23:48:55.297050Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.297050Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:a475ae19c348ce31cf8f90d75a5f8e76842f18722ae8cecaac6c491e4fca7a00","observation_id":"69227d5a-2832-4df6-8289-6c8aec76d1bb","resolution":{"observed_at":"2026-08-02T23:48:55.297050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:55.369035Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.369035Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:53cb2738475bd9eacedc7194e2c19d88cfe939bf9a05ea8e7744d3ada41cbae6","observation_id":"3d90655f-407e-4843-982d-9260ac109a8d","resolution":{"observed_at":"2026-08-02T23:48:55.369035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-02T23:48:55.501648Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.501648Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:6bbb27de1c36dcd2b90c85a92478a2ca514b91d86f0d37e90b8ac39fc1847fcd","observation_id":"c7cf64e9-b3fa-4ef7-8f2a-60b138c50d0e","resolution":{"observed_at":"2026-08-02T23:48:55.501648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:55.607861Z","title":"The r2r framework: Publishing and discovering mappings on the web.COLD, 665:97–108, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.607861Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:12537bb357936bb53e3b0b9059e957d11fc48e61577652bea13ce98a29b750c8","observation_id":"6afe496c-9f34-457f-b06e-d5df297bab06","resolution":{"observed_at":"2026-08-02T23:48:55.607861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T23:48:55.703806Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.703806Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:34e514b1e58a46b0190fd92eb4b9b754f1414cc56fa37280891faa1de9c68033","observation_id":"2a0f81bc-9fbc-4c27-990e-02e94bea70eb","resolution":{"observed_at":"2026-08-02T23:48:55.703806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T23:48:55.768219Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.768219Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:8c6e88d5a27db93f4e7cc04639dcf535c05a402fe1eb7db44bb96eec1938661e","observation_id":"8a2f0396-42a1-447f-b8f0-11a5f8c085be","resolution":{"observed_at":"2026-08-02T23:48:55.768219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T23:48:55.812866Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.812866Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:5a1ea6b4fc837c9634336f64d70f16daa7b28fab9bbfe6af3faf91abb8dad989","observation_id":"a1c86820-8c0d-4a06-b185-99460bf02c71","resolution":{"observed_at":"2026-08-02T23:48:55.812866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:55.871238Z","title":"The ycb object and model set: Towards common benchmarks for manipulation research","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.871238Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:6bbe4e24327f00beccbe42a0559edc04a74662b44cb76dd5faff152a845a2d5b","observation_id":"6ff5d23c-c347-48d9-bd5f-6dba6bfcc7eb","resolution":{"observed_at":"2026-08-02T23:48:55.871238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03012","last_updated":"2015-12-09T19:42:48Z","snapshot_observed_at":"2026-08-11T21:14:03.563893Z","submitted_at":"2015-12-09T19:42:48Z","title":"ShapeNet: An Information-Rich 3D Model Repository","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03012","snapshot_observed_at":"2026-08-02T23:48:55.960759Z","title":"Shapenet: An information-rich 3d model repository.arXiv preprint arXiv:1512.03012, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:55.960759Z"},"links":{"cited_paper":"/paper/1512.03012","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:8f48f0452eb2157d15b8496df4f1d63cb02ca8d10d838bae6f44c0df3c62560c","observation_id":"a286c1d0-5f10-4073-8552-e4318edba703","resolution":{"observed_at":"2026-08-02T23:48:55.960759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08981","last_updated":"2021-03-30T08:20:34Z","snapshot_observed_at":"2026-08-09T09:33:13.219731Z","submitted_at":"2021-02-17T19:15:53Z","title":"Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08981","snapshot_observed_at":"2026-08-02T23:48:56.083452Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual con- cepts, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:56.083452Z"},"links":{"cited_paper":"/paper/2102.08981","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:9552ab988ce55a9cab68cddd01747a0122a088bbd072d32e8a983c0ac5fa7c21","observation_id":"b797cd48-dee6-449b-8469-a669a19acbf1","resolution":{"observed_at":"2026-08-02T23:48:56.083452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:56.193968Z","title":"Closing the sim-to-real loop: Adapting simulation randomization with real world experience","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:56.193968Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:180d2f666493c2d3de325569cd363eb778023688e7c363ae65addbbd56597001","observation_id":"837802a2-2908-4492-b2d1-0909ea1a6b99","resolution":{"observed_at":"2026-08-02T23:48:56.193968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:56.294254Z","title":"URL https: //arxiv.org/abs/2510.25889","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:56.294254Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:2da60939f409d6fbee480be9e441d0cb2aa0def8d96208a026df8d5d14d4e038","observation_id":"282fd24b-90f3-4a70-a29f-40dfbc078c62","resolution":{"observed_at":"2026-08-02T23:48:56.294254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-02T23:48:56.406404Z","title":"Sharegpt4v: Improving large multi-modal models with better cap- tions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:56.406404Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:50d54d06791d95ecccecfbfc183b1c622f0ffc44b08b4a180b6ba1d6ee288815","observation_id":"5c970ca3-6b6f-49ae-8cda-a266466aad89","resolution":{"observed_at":"2026-08-02T23:48:56.406404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-02T23:48:56.520705Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain random- ization for robust bimanual robotic manipulation.arXiv preprint arXiv:2506.18088, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:56.520705Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:ea576e419b458b358075b28970ec90d7ee4f116a49b3de0fff903152915bf7ef","observation_id":"9de5d3ad-0c5a-4c49-aefc-af1f6632ab35","resolution":{"observed_at":"2026-08-02T23:48:56.520705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:56.633307Z","title":"Generalizable domain adaptation for sim-and-real policy co-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:56.633307Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:532f46b1153f580dee06f65334fc0d4bc3383633b2f0f36cafefa8cb916ce69b","observation_id":"f1e56d64-6c93-495d-ac3f-89a95ad83e58","resolution":{"observed_at":"2026-08-02T23:48:56.633307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07408","last_updated":"2024-10-19T00:08:19Z","snapshot_observed_at":"2026-08-05T03:52:02.739668Z","submitted_at":"2024-10-09T20:17:58Z","title":"Automated Creation of Digital Cousins for Robust Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07408","snapshot_observed_at":"2026-08-02T23:48:56.712709Z","title":"Automated creation of digital cousins for robust policy learning.arXiv preprint arXiv:2410.07408, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:56.712709Z"},"links":{"cited_paper":"/paper/2410.07408","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:c3af1cae0610b679097b82b60745d07e0b0dcdc5951c04f2a98dd1183475d37d","observation_id":"0e448b06-eb78-4a2c-8470-4629ebbf93a5","resolution":{"observed_at":"2026-08-02T23:48:56.712709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:56.824247Z","title":"Objaverse-xl: A universe of 10m+ 3d objects.Advances in Neural Information Processing Systems, 36:35799– 35813, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:56.824247Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:6e662d0070c695598272208b284d0164e1f6517e7064cb7400d57762c63253ae","observation_id":"b10b93c9-fef6-4367-812e-795dbc4cdb4a","resolution":{"observed_at":"2026-08-02T23:48:56.824247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:56.932854Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:56.932854Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:5682883ca0dec6acc0cbe3140a9e25ba97cdd970d93a8d9296b72b66a1941bae","observation_id":"0dfdf214-0518-40d1-bf97-fd743dcbda24","resolution":{"observed_at":"2026-08-02T23:48:56.932854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-07-06T07:49:17.886466Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-08-02T23:48:57.035363Z","title":"Challenges of real-world reinforcement learning","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:57.035363Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:143f2ae2ed3a224c4350df475d698df5aecf0e9c140ab55bec539480a9e2ae22","observation_id":"4aa962d1-a4cb-44bf-a64d-7b077b1f8baf","resolution":{"observed_at":"2026-08-02T23:48:57.035363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:57.109819Z","title":"Bridge data: Boosting generalization of robotic skills with cross- domain datasets, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:57.109819Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:d727444d72d5a86c153d4838c31ecaa5fa961feb8ff854f7d14c224f81dc165e","observation_id":"8d11e19f-87e8-4781-9fdf-7d0fe89a0f52","resolution":{"observed_at":"2026-08-02T23:48:57.109819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:57.156984Z","title":"Sim-and-human co-training for data- efficient and generalizable robotic manipulation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:57.156984Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:011c217a1ac74a533b3a1ea063d9ac91479b22bbf3caba0eb6b2383eaab73899","observation_id":"c740db79-c3d8-4792-bc17-2e305cd322bb","resolution":{"observed_at":"2026-08-02T23:48:57.156984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04659","last_updated":"2023-02-09T14:24:01Z","snapshot_observed_at":"2026-08-08T14:45:35.755677Z","submitted_at":"2023-02-09T14:24:01Z","title":"ManiSkill2: A Unified Benchmark for Generalizable Manipulation Skills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04659","snapshot_observed_at":"2026-08-02T23:48:57.271382Z","title":"Maniskill2: A unified benchmark for generalizable manipulation skills.arXiv preprint arXiv:2302.04659, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:57.271382Z"},"links":{"cited_paper":"/paper/2302.04659","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:2be9a85cfe80e137c685429c97dfd804c544eef0621911eee7e9abcd7d13b95b","observation_id":"5d9f1f76-c22e-42fc-b644-5dd28afaf6ba","resolution":{"observed_at":"2026-08-02T23:48:57.271382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:57.427603Z","title":"Airbert: In-domain pretraining for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:57.427603Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:f81ca2cc5116e466e31e13fda9003d47b76e7633e5d0545df3ae11f5cd2f6faa","observation_id":"5edaf50e-4315-45b6-9ea9-9009fb0c46f4","resolution":{"observed_at":"2026-08-02T23:48:57.427603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:57.564187Z","title":"Towards learning a generic agent for vision-and-language navigation via pre-training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:57.564187Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:480c4a83fc9500fb7f2a52cf668488fe1cc134008334edb1cc2d942ae07b104e","observation_id":"108bd3a8-8724-4870-81a5-7b083f5f2c9c","resolution":{"observed_at":"2026-08-02T23:48:57.564187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:57.715735Z","title":"Vln bert: A recurrent vision- and-language bert for navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:57.715735Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:6c30cb6a77657798b8220e9ee38eeb9b311c6070bf6b91fb978e76b1d82fa4da","observation_id":"d9b80694-0e5c-44c1-8c72-341f18fed864","resolution":{"observed_at":"2026-08-02T23:48:57.715735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:57.810846Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:57.810846Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:e8b8ec752740fbbb8451091cd0c3d9958d006bcc6ab9657a2d7daf97cb564fbe","observation_id":"239b05dd-2c7f-4c2e-b40d-47c5b4b1c763","resolution":{"observed_at":"2026-08-02T23:48:57.810846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-02T23:48:57.949446Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:57.949446Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:e082ce63c0579d61aafecb6bddc7ff5a1768c67ebc2b71e01b7a1739deb2867a","observation_id":"65c3e564-9f56-4902-ac84-9ac87c0dd074","resolution":{"observed_at":"2026-08-02T23:48:57.949446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T23:48:58.046107Z","title":"pi {0.5}: a vision-language-action model with open- world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.046107Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:5a4e348d6cf96e9bf26b6d73ee8f2fb19de9bd90e808a7d38e81d231f60052d0","observation_id":"dfe368ce-6ede-4d57-a0e1-890224b89277","resolution":{"observed_at":"2026-08-02T23:48:58.046107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-07T13:44:24.778030Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-02T23:48:58.160509Z","title":"Vima: General robot manipulation with multimodal prompts.arXiv preprint arXiv:2210.03094, 2(3):6, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.160509Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:abe71c0ecfb991ea2f01dadb2cc1135e2b4140f72d0469a785dc5e05973186a1","observation_id":"7a51e6b2-0f00-43e3-9c36-19347d99f9c8","resolution":{"observed_at":"2026-08-02T23:48:58.160509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.10293","last_updated":"2018-11-28T02:40:54Z","snapshot_observed_at":"2026-08-02T20:30:39.614115Z","submitted_at":"2018-06-27T04:34:30Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.10293","snapshot_observed_at":"2026-08-02T23:48:58.328749Z","title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipulation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.328749Z"},"links":{"cited_paper":"/paper/1806.10293","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:3bf6fa7a1cc0830ef0a55bb174eb4e870b2d5f24f60bf266389743bfe9931a5b","observation_id":"0bf2d53a-8726-4b2a-a61d-2a2d6bd29683","resolution":{"observed_at":"2026-08-02T23:48:58.328749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:58.408204Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.408204Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:a6b63ea5bb5ed44478de44fb766f32b4953aef56bc672c4648f453ec21ba2dea","observation_id":"e09bd3ca-cfd4-4820-b259-346a70babba8","resolution":{"observed_at":"2026-08-02T23:48:58.408204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-02T23:48:58.485677Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.485677Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:00d08eac7b5b581b98e2e8a297cbb3c55b0194a372e5b5dd1d884534a0066261","observation_id":"6d2b50bc-b2b8-407f-aed5-aa3a65b80ec7","resolution":{"observed_at":"2026-08-02T23:48:58.485677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T23:48:58.559248Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.559248Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:e5e5a684ead7f3f51ebabd1b0cb5871f85ff6a077a7355c5f8f6f2a787b1aaf1","observation_id":"50fed8f2-38a4-4fa0-9fed-1b8d4fb33790","resolution":{"observed_at":"2026-08-02T23:48:58.559248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-02T23:48:58.670284Z","title":"Fine- tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.670284Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:27f697ffcc3d466363a83a978fdc5bfd2c44273d1fecfcf62eb36c51dd7c017d","observation_id":"a424bdda-7842-42f6-be7f-35986eaea3ff","resolution":{"observed_at":"2026-08-02T23:48:58.670284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07954","last_updated":"2020-10-15T18:01:15Z","snapshot_observed_at":"2026-07-06T10:04:55.122236Z","submitted_at":"2020-10-15T18:01:15Z","title":"Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07954","snapshot_observed_at":"2026-08-02T23:48:58.731930Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotempo- ral grounding.arXiv preprint arXiv:2010.07954, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.731930Z"},"links":{"cited_paper":"/paper/2010.07954","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:ab59e6c5ee3121b726cbfb2ccbae080e12a4a0cd9030ab9e7eb610f67a9da823","observation_id":"bedf0b36-102c-48fe-a757-0962240c6c86","resolution":{"observed_at":"2026-08-02T23:48:58.731930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09674","snapshot_observed_at":"2026-08-02T23:48:58.812303Z","title":"Simplevla-rl: Scaling vla training via reinforcement learning.arXiv preprint arXiv:2509.09674, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.812303Z"},"links":{"cited_paper":"/paper/2509.09674","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:c36429c36426179a2f15d49a66c71eed5f2e06738437a0796596bfba999f4440","observation_id":"05ecb8a6-185b-4756-b3c0-6f57b7d934ed","resolution":{"observed_at":"2026-08-02T23:48:58.812303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11839","last_updated":"2025-08-03T09:06:58Z","snapshot_observed_at":"2026-08-10T15:11:03.196878Z","submitted_at":"2024-11-18T18:58:03Z","title":"RoboGSim: A Real2Sim2Real Robotic Gaussian Splatting Simulator","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11839","snapshot_observed_at":"2026-08-02T23:48:58.850365Z","title":"Robogsim: A real2sim2real robotic gaussian splatting simulator.arXiv preprint arXiv:2411.11839, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.850365Z"},"links":{"cited_paper":"/paper/2411.11839","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:5a557dd64ceab52db61718c40a3a44eab281f4fc7faf68ccc48cef3add37a3fa","observation_id":"60167d4b-159f-40da-ac14-90a2e039470e","resolution":{"observed_at":"2026-08-02T23:48:58.850365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:58.907946Z","title":"Gr-rl: Going dexterous and precise for long-horizon robotic manipulation.arXiv preprint arXiv:2512.01801, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.907946Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:61542977cfae4516c55293b74b7f6d332c7ebf0d81bc0467cf763a1a8692a37e","observation_id":"836d58d0-5f70-4237-898a-4f4496fc8a6d","resolution":{"observed_at":"2026-08-02T23:48:58.907946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-02T23:48:59.051315Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.051315Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:396a1bb527eea6ee0d76b58a793f55b09d70b11fd94bd5042f1ac41bc582f83c","observation_id":"a91bec37-e355-4a20-8134-4371d87e530d","resolution":{"observed_at":"2026-08-02T23:48:59.051315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-11T19:26:36.911580Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-08-02T23:48:59.184987Z","title":"Flow-grpo: Training flow matching models via online rl.arXiv preprint arXiv:2505.05470, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.184987Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:7f54a532aaf7c4b538245c6c23d18ee2e631f4ea9c3f2590c3e737c69c01cdb8","observation_id":"71584382-a73d-4a81-bcaa-242864dff902","resolution":{"observed_at":"2026-08-02T23:48:59.184987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:59.240329Z","title":"What can rl bring to vla generalization? an empirical study.arXiv preprint arXiv:2505.19789, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.240329Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:15838e2e0deb5d4adc20628d8554b108c3e1c3bff69528912ae2e86a2ab5f6e9","observation_id":"89996bc0-322a-4867-945e-fca94deafa95","resolution":{"observed_at":"2026-08-02T23:48:59.240329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-02T23:48:59.285658Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.285658Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:3bbe1c6684f70525e9fbe0a4529277ad96f962de31a6edceca22350ec2e6ab24","observation_id":"932f9bad-285c-41c0-abb1-b8b2dc343239","resolution":{"observed_at":"2026-08-02T23:48:59.285658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:59.379112Z","title":"Serl: A software suite for sample-efficient robotic reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.379112Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:9f877612a14f3417672c0219a88c4147d0b5350f27bb15badd204941a8e6034b","observation_id":"e5a2bece-4eb7-4d2a-a9d0-23785dfc9c4c","resolution":{"observed_at":"2026-08-02T23:48:59.379112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24361","last_updated":"2025-04-02T16:40:11Z","snapshot_observed_at":"2026-08-10T15:01:42.148210Z","submitted_at":"2025-03-31T17:39:38Z","title":"Sim-and-Real Co-Training: A Simple Recipe for Vision-Based Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24361","snapshot_observed_at":"2026-08-02T23:48:59.417592Z","title":"Sim-and-real co-training: A simple recipe for vision-based robotic manipulation.arXiv preprint arXiv:2503.24361, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.417592Z"},"links":{"cited_paper":"/paper/2503.24361","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:75ad45daa41cda73f420b74177d114190d4bf366692781fdd8e0e8cc7d633116","observation_id":"df251004-bb0e-4d1d-a5a7-ebe2c30610a1","resolution":{"observed_at":"2026-08-02T23:48:59.417592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-02T23:48:59.505472Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning.arXiv preprint arXiv:2108.10470, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.505472Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:5043dc1c84f970879238dd256ba30b7f5f50c41adf5e8fddebba64dcfe431fc7","observation_id":"950468ad-db31-4a23-a1e5-7554bd7586cf","resolution":{"observed_at":"2026-08-02T23:48:59.505472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17596","last_updated":"2023-10-26T17:17:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-26T17:17:31Z","title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17596","snapshot_observed_at":"2026-08-02T23:48:59.546792Z","title":"Mimicgen: A data generation system for scalable robot learning using human demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.546792Z"},"links":{"cited_paper":"/paper/2310.17596","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:dc2bd40016cb087f5f74857c3d23f21f88b640e11c04ee93fa60fc87a6b4efd8","observation_id":"a2609a87-753c-4d44-aea1-304a1c8f67c6","resolution":{"observed_at":"2026-08-02T23:48:59.546792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:59.610401Z","title":"Active domain randomiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.610401Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:036c581b20e181f9ebf2304235be795900e7b321410f2208cd1cf031af927528","observation_id":"2fa6c766-59b2-4f47-b085-d21981d3ee62","resolution":{"observed_at":"2026-08-02T23:48:59.610401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-08-10T22:26:40.514135Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-08-02T23:48:59.699822Z","title":"Maniskill: Generalizable manipulation skill bench- mark with large-scale demonstrations.arXiv preprint arXiv:2107.14483, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.699822Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:09f68d3f73b30006037703f771fd3ea980b674eb2a9a5f9fd0c3317b8296b6f5","observation_id":"c6ac8c67-9a24-42ea-8a07-350fc3638935","resolution":{"observed_at":"2026-08-02T23:48:59.699822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-08-02T23:48:59.774612Z","title":"Robocasa: Large-scale simulation of everyday tasks for generalist robots.arXiv preprint arXiv:2406.02523, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.774612Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:5cfc040fb96ab05e63e5c23e3883dcb4a762e1b545e8a291a3f77755a6d08738","observation_id":"703261df-11e0-4c25-86a5-e76eeca68261","resolution":{"observed_at":"2026-08-02T23:48:59.774612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:59.867282Z","title":"An algo- rithmic perspective on imitation learning.Foundations and Trends® in Robotics, 7(1-2):1–179, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.867282Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:3bf03d330804df5a1139357dca4195b0b4293fd1474680b6107a5808048806b9","observation_id":"25ac4953-4123-49f5-917a-71546725ce92","resolution":{"observed_at":"2026-08-02T23:48:59.867282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:48:59.984155Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:59.984155Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:4ceba702f35c4aa6fd238cc4646dcfb7d3fb840d0ef7d358428261fe4021e8aa","observation_id":"df2bc198-d76b-4299-afc0-1e701b94ac0d","resolution":{"observed_at":"2026-08-02T23:48:59.984155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:00.162601Z","title":"Sim-to-real transfer of robotic control with dynamics randomization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:00.162601Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:7609861e2dceb59504b5756accf84b0b6274722820e46d1b6e345551d7f40af6","observation_id":"7c3c28f8-d0e4-417d-b2ad-ec32ed6b190b","resolution":{"observed_at":"2026-08-02T23:49:00.162601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:00.240540Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:00.240540Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:763290814e16abc9880414d02dbe26ffcee0b940a3681a0545d19c7c138fa320","observation_id":"aa96b96c-8ff1-400e-b1ae-76e729852717","resolution":{"observed_at":"2026-08-02T23:49:00.240540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:00.315846Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:00.315846Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:dde3679f7d38fe3625e5a695ba27ea9b502b43bcd8f0d208cd2ba3c5d01ac150","observation_id":"5a974846-25a1-44bc-8ed3-3ed552818365","resolution":{"observed_at":"2026-08-02T23:49:00.315846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:00.402882Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural information processing systems, 35:25278– 25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:00.402882Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:155607544fb033d823a856cc80267694d8b34fc1f247423cb409e758027650c9","observation_id":"ce9a3e1d-2efd-4116-8ed2-deabb6002dce","resolution":{"observed_at":"2026-08-02T23:49:00.402882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T23:49:00.537756Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:00.537756Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:a28a4174871dafe7f0a877199c866e7b4c8b8350084630a0483c15e6a22e3373","observation_id":"c1b56d95-8ea5-4dc1-b9b8-9ff0b612fee9","resolution":{"observed_at":"2026-08-02T23:49:00.537756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:00.617702Z","title":"Videovla: Video generators can be generalizable robot manipulators.arXiv preprint arXiv:2512.06963, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:00.617702Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:3bbc25ad386dc18af3a6f54d8b8f2967704e5b5d57d35eb1c9d7164685c7aa66","observation_id":"d78e8f76-18b2-45fe-93fc-a85e90ee7dbc","resolution":{"observed_at":"2026-08-02T23:49:00.617702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00425","last_updated":"2025-05-30T05:49:14Z","snapshot_observed_at":"2026-07-06T19:25:06.162911Z","submitted_at":"2024-10-01T06:10:39Z","title":"ManiSkill3: GPU Parallelized Robotics Simulation and Rendering for Generalizable Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00425","snapshot_observed_at":"2026-08-02T23:49:00.760526Z","title":"Maniskill3: Gpu parallelized robotics simulation and rendering for gener- alizable embodied ai.arXiv preprint arXiv:2410.00425, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:00.760526Z"},"links":{"cited_paper":"/paper/2410.00425","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:427a3b138c7cb22f371c93425fd2a6584c5615318104b0b22ad4a5692c651c24","observation_id":"518640b5-0678-4224-bfef-de014e116198","resolution":{"observed_at":"2026-08-02T23:49:00.760526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:00.934757Z","title":"Evaluating gemini robotics policies in a veo world simulator.arXiv preprint arXiv:2512.10675, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:00.934757Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:3cfd9113a65ccb0f460cb8e4edf91ba4468eb2111b45a3c9ab5ec7263101e85a","observation_id":"2929f278-f9e9-4395-a879-a62502d26922","resolution":{"observed_at":"2026-08-02T23:49:00.934757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-02T23:49:01.043861Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:01.043861Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:c527492f9a4907d2534087cf12d2422b7ecc49ef6da7231850097fa3f7074651","observation_id":"31c2bb92-1ba1-4463-8526-836c720c865c","resolution":{"observed_at":"2026-08-02T23:49:01.043861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T23:49:01.157381Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:01.157381Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:a2061367b4343cfa875804771f6bd911738eafaaccf46289902089b416fd7869","observation_id":"4dcba3d1-350b-46a4-8cca-5fa188a81264","resolution":{"observed_at":"2026-08-02T23:49:01.157381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:01.265440Z","title":"Vision-and-dialog navigation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:01.265440Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:cd219c459782d188ac070493ff9fa66b1534190fcac00d13b87b75a7a92ec6ac","observation_id":"1f4b8432-d611-4dce-a9e7-cf0021c28436","resolution":{"observed_at":"2026-08-02T23:49:01.265440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:01.460377Z","title":"Domain ran- domization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:01.460377Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:bb912f2a90db2129517d0ec378797815c6c299978f11a9b2311969b7823700aa","observation_id":"60086f30-49d5-494b-b9d9-3bd2917af922","resolution":{"observed_at":"2026-08-02T23:49:01.460377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:01.642862Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:01.642862Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:436ada1594aa5b3edbdef6102267be5d8488b878355ce08b3616b697a3f4ac86","observation_id":"f102ba7b-60ae-49e8-9674-382b5881c67c","resolution":{"observed_at":"2026-08-02T23:49:01.642862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-08-09T09:28:00.163287Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-08-02T23:49:01.747074Z","title":"Rec- onciling reality through simulation: A real-to-sim-to- real approach for robust manipulation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:01.747074Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:b24a3f44ee2931a79a7564f885620c5d5f4823a3c8634f041e865bb55ef5f5d1","observation_id":"749f911e-6f1b-4ff4-9468-3a017fb282c6","resolution":{"observed_at":"2026-08-02T23:49:01.747074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-02T23:49:01.861640Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:01.861640Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:df39a20e6be5a4c0d5c8a0ed696af66c59d4038843410b522e7242393ad7ecae","observation_id":"06268b50-dc20-40d1-a435-083977e4b91e","resolution":{"observed_at":"2026-08-02T23:49:01.861640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:01.996145Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:01.996145Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:d48dd71d88a8cf2cc8438137c5de7a21333153a6b66fb8f081c0b6322c9e1186","observation_id":"eecfe2d6-e0f6-46ca-96b5-60bcc34f62cd","resolution":{"observed_at":"2026-08-02T23:49:01.996145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22634","last_updated":"2025-08-05T18:17:52Z","snapshot_observed_at":"2026-08-08T17:39:08.307239Z","submitted_at":"2025-03-28T17:25:57Z","title":"Empirical Analysis of Sim-and-Real Cotraining of Diffusion Policies for Planar Pushing from Pixels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22634","snapshot_observed_at":"2026-08-02T23:49:02.144147Z","title":"Empirical analysis of sim-and-real cotraining of diffusion poli- cies for planar pushing from pixels.arXiv preprint arXiv:2503.22634, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:02.144147Z"},"links":{"cited_paper":"/paper/2503.22634","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:b70bc06f0c87a921b178d7d43830abfd13d0b411ba543765ce022570411e1bd5","observation_id":"adf8a657-1748-4a61-b9fc-ebfe8c7f001c","resolution":{"observed_at":"2026-08-02T23:49:02.144147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:02.285758Z","title":"Rl-gsbridge: 3d gaussian splatting based real2sim2real method for robotic manipulation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:02.285758Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:5d4d1c51ae03c3380339a53e0d17a192ef74aa5d7c66ec1c0a397374564b7b49","observation_id":"a4dcdf56-bdfe-412a-afb2-6fc6fa64e8ab","resolution":{"observed_at":"2026-08-02T23:49:02.285758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T23:49:02.431397Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:02.431397Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:a779833e2e5b5b2aa9c8fc790fb1bfd10446cd1869c10a48c7e7997697693919","observation_id":"b347b7a0-e63b-45f8-ad9b-16c7a1d3732f","resolution":{"observed_at":"2026-08-02T23:49:02.431397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:02.592585Z","title":"Invari- ance co-training for robot visual generalization.arXiv preprint arXiv:2512.05230, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:02.592585Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:e33f736bb7eae61a7d8be92a7553bdb6f39f747183959f17fbf7ef5972853e4b","observation_id":"a285db93-4cd4-4295-b0f8-98a0b2c544fd","resolution":{"observed_at":"2026-08-02T23:49:02.592585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05877","last_updated":"2021-08-10T14:07:44Z","snapshot_observed_at":"2026-08-07T23:27:04.115096Z","submitted_at":"2020-12-10T18:36:40Z","title":"INeRF: Inverting Neural Radiance Fields for Pose Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05877","snapshot_observed_at":"2026-08-02T23:49:02.818761Z","title":"Barron, Al- berto Rodriguez, Phillip Isola, and Tsung-Yi Lin","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:02.818761Z"},"links":{"cited_paper":"/paper/2012.05877","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:d485a30cd55ce58dbea1b75222aa95e9490f209d90160a7572b6c0f4541e0c45","observation_id":"dbf81d85-2fb7-4d0b-bece-c332fd77194b","resolution":{"observed_at":"2026-08-02T23:49:02.818761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10020","last_updated":"2024-07-02T07:29:04Z","snapshot_observed_at":"2026-07-06T18:15:11.806744Z","submitted_at":"2024-05-16T12:02:02Z","title":"Natural Language Can Help Bridge the Sim2Real Gap","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10020","snapshot_observed_at":"2026-08-02T23:49:02.985771Z","title":"Natural language can help bridge the sim2real gap.arXiv preprint arXiv:2405.10020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:02.985771Z"},"links":{"cited_paper":"/paper/2405.10020","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:ba250795944cd8c11a408c074ba3a566aefc485fa1e5fdefb04e20d297672a51","observation_id":"fb0b1bd3-feca-4835-b7d4-f03179d5f686","resolution":{"observed_at":"2026-08-02T23:49:02.985771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:03.144415Z","title":"Rlinf: Flexible and efficient large- scale reinforcement learning via macro-to-micro flow transformation.arXiv preprint arXiv:2509.15965, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:03.144415Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:780224ca264a76b7fdd61ab410cc8abc84d765d3c758344eb47c80d09ad15cc5","observation_id":"3031cebb-d6a7-4e25-95f0-9f8a73b6d9e4","resolution":{"observed_at":"2026-08-02T23:49:03.144415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-07-06T08:31:50.962710Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-08-02T23:49:03.275426Z","title":"Meta- world: A benchmark and evaluation for multi-task and meta reinforcement learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:03.275426Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:0055c8bf4e218dcff2c0dd56ca86c24777648bf813f854dfef921b580c5bc982","observation_id":"1a8bc444-43a8-4f04-963c-e6bc63f7afc4","resolution":{"observed_at":"2026-08-02T23:49:03.275426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:03.416040Z","title":"Rlinf-vla: A unified and efficient frame- work for reinforcement learning of vision-language- action models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:03.416040Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:eb6e1f637f4854ac3d0756f741d5552a21bdf024cffec02a691b54452a7f8d93","observation_id":"0600883d-39e6-473b-b61e-474abd25378b","resolution":{"observed_at":"2026-08-02T23:49:03.416040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:03.549584Z","title":"Real- to-sim robot policy evaluation with gaussian splatting simulation of soft-body interactions.arXiv preprint arXiv:2511.04665, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:03.549584Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:676ea78fe7e8b275b3aea6350354a65342003ff2109b491426d93fe16da7f307","observation_id":"eb291e34-4f36-4747-92b3-121857de97b8","resolution":{"observed_at":"2026-08-02T23:49:03.549584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18194","last_updated":"2024-12-24T06:03:42Z","snapshot_observed_at":"2026-08-11T04:54:18.910403Z","submitted_at":"2024-12-24T06:03:42Z","title":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18194","snapshot_observed_at":"2026-08-02T23:49:03.695895Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:03.695895Z"},"links":{"cited_paper":"/paper/2412.18194","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:072391c38d2dc430cd238ccd838be90fa9bcddfe82791f95a0e0e9cc169d2890","observation_id":"4cd4cb20-7d0a-4d33-833a-a0527cd597af","resolution":{"observed_at":"2026-08-02T23:49:03.695895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:03.896128Z","title":"Re- inflow: Fine-tuning flow matching policy with online re- inforcement learning.arXiv preprint arXiv:2505.22094, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:03.896128Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:35227e14af7b8fe1adc82f20d443b6fa5b1cca92809f78ff82bbd6f9d641ae0f","observation_id":"07c31fe2-9dc2-4553-8702-8e77d312fe0b","resolution":{"observed_at":"2026-08-02T23:49:03.896128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:04.008280Z","title":"Sac flow: Sample-efficient reinforce- ment learning of flow-based policies via velocity- reparameterized sequential modeling.arXiv preprint arXiv:2509.25756, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:04.008280Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:4c4217284151527b7ac8b1327d02b69edd52462779035cb4c183ef41871f9724","observation_id":"00b74cbe-ac69-48ee-b69e-de9c97a6d677","resolution":{"observed_at":"2026-08-02T23:49:04.008280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05495","last_updated":"2025-05-05T17:59:17Z","snapshot_observed_at":"2026-08-07T15:56:18.014752Z","submitted_at":"2025-05-05T17:59:17Z","title":"Learning 3D Persistent Embodied World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05495","snapshot_observed_at":"2026-08-02T23:49:04.208684Z","title":"Learning 3d persistent embodied world models.arXiv preprint arXiv:2505.05495, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:04.208684Z"},"links":{"cited_paper":"/paper/2505.05495","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:4b1e2ea4de3e677033162340ea5527565e7f2732102ef754a836fea568beb573","observation_id":"c1931af5-89c4-4f74-88ec-e0c84efd5bb7","resolution":{"observed_at":"2026-08-02T23:49:04.208684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14540","last_updated":"2025-07-29T16:48:03Z","snapshot_observed_at":"2026-08-06T20:16:51.288291Z","submitted_at":"2024-06-20T17:50:16Z","title":"IRASim: A Fine-Grained World Model for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14540","snapshot_observed_at":"2026-08-02T23:49:04.287251Z","title":"Irasim: Learning in- teractive real-robot action simulators.arXiv preprint arXiv:2406.14540, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:04.287251Z"},"links":{"cited_paper":"/paper/2406.14540","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:78c29530280f3d1220570ce1063393631b383b4f318849ece1a45f7447c89423","observation_id":"246a5e94-f1fa-46c3-83f7-fa6625419b92","resolution":{"observed_at":"2026-08-02T23:49:04.287251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:04.343005Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:04.343005Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:83b6e0455c08b6c9dfa695b1c122cd16587120716243d7f57f87748320dd99b0","observation_id":"16cff3e9-b458-4c63-a547-38bf26727c70","resolution":{"observed_at":"2026-08-02T23:49:04.343005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:04.516794Z","title":"9 visualizes the four table-top manipulation tasks evaluated in our experiments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:04.516794Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:fbca2754fb4daaf2175b1d4f2bd9af3f1da28662a5d084677724302c11f9cf5b","observation_id":"ca0503c5-21c1-4943-93ed-a6f1284dcd1d","resolution":{"observed_at":"2026-08-02T23:49:04.516794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:04.656900Z","title":"10 shows the manipulated objects used in both simulation and real-world experiments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:04.656900Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:ef831098d5f2cc63e7f53868b27d358d41278291be15fc15a0adfcb4fa9122d4","observation_id":"0beb48bd-0b27-4810-844e-cdddc2e930a9","resolution":{"observed_at":"2026-08-02T23:49:04.656900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:04.834261Z","title":"11 illustrates the randomized regions for the four real-world tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:04.834261Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:ddee3311d260e5ed4e9013c074afc3c78c2925e0aae277b41c2e051070d46bfc","observation_id":"3c471d34-af63-4afe-9dd1-1e4b02d7b832","resolution":{"observed_at":"2026-08-02T23:49:04.834261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:05.027202Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:05.027202Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:323ac0398165625f3e789d44614a0ab67eba59bda26e14bc1e8de2f1d3063c99","observation_id":"8f37aa55-ad2d-429d-abed-49c92c8b78d3","resolution":{"observed_at":"2026-08-02T23:49:05.027202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:05.208709Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:05.208709Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:862fa5f53753b6cf8d974314c6c3564496496304d0305f1097437e9a69b57d15","observation_id":"a40a66c7-a95e-4ee7-9b81-ab32c117a8f0","resolution":{"observed_at":"2026-08-02T23:49:05.208709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:49:05.337733Z","title":"12 shows the success rates of different models on each task in the simulation environment during RL training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T23:49:05.337733Z"},"links":{"citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:e9c7951b376b0e42b4f5ad6af634aef398e7a1b940ccc9619e0fb9eb27ebcef7","observation_id":"84e0a516-b098-40c7-9a6f-479f3fa45090","resolution":{"observed_at":"2026-08-02T23:49:05.337733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","latest_version":4,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T09:28:24.166145Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":91,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 2 inbound Pith citation observations for arXiv:2602.12628."}