{"as_of":"2026-08-05T09:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe4c083d4cd75f702fde8642064233c6775456ac0afff42a5669fdf971da22ad","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T16:10:12.689957Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.28730/citation-record","integrity":"/paper/2603.28730/integrity","json":"/paper/2603.28730/citation-record.json","paper":"/paper/2603.28730"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:9eaa4881f35cb717e7fa0538f9820e47105c5e4afc9f943230c4a51fe8150a50","observation_id":"62a3df6c-1b59-466b-8c5c-f437165af3be","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:f204febaa57afe9e0876f71283f33f42ce95e95f6df5a967e50e9f85bd2d182d","observation_id":"9598803c-ec5a-4079-addf-f7da5a91ce3c","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:8d8c5fc6377c3ffc71c0788e0c0d31cc8846b717889dbe90c6854e0dcdb2599a","observation_id":"afa849d1-9faa-4e20-893f-9ab9872b4bf5","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09187","last_updated":"2024-07-12T21:14:32Z","snapshot_observed_at":"2026-07-06T17:02:01.491624Z","submitted_at":"2023-12-14T18:06:17Z","title":"Vision-Language Models as a Source of Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09187","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2312.09187","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:19b54ffd40a384098c0311da27648cf3da89910e1d49528c6f22977cd0e9d6d1","observation_id":"9ff64ef4-43cb-4187-8a91-b9730e3e8d1b","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"J., Platt, R., van de Meent, J.-W., and Wong, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:543b1dab8c25bab93df0a699a4dd720ee61d201cac76cf173c484ea208b37978","observation_id":"4f345bdf-4225-48aa-9cb4-a2ab1daeb8ba","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:a90c80bd3ff3ee0f233b4de242069b0beec0fbcc0e490d026564eba9cea28fdc","observation_id":"0025c0cf-90cb-4a0e-9c54-a1b7d4601509","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:d980e3a3ace911aade99e62dceb2f2eb67f1a5057c402e88598002d738d12553","observation_id":"49283563-5e29-423a-bb3b-c6dfb84b6485","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-02T19:24:45.895739Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:ef7734c508944e80d4cf822c42154fe4f8fa61577cd5eff2065a647ef372b144","observation_id":"dc63545e-e5f0-43f7-a984-90ee3e098ed3","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-07-06T21:27:51.964897Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"R., and Goldberg, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:e8b97676e36261ddb21a2a373222e63505199a958613ef3aaf07165c25ee9062","observation_id":"ab07615c-fe48-4386-9ebc-e6962892d043","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"J., Ren, Z., Ratliff, L","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:47df99881fc160abaf512644b32524c95b3354bcf2388d301de28fd25e7dad69","observation_id":"d3a58e38-4f87-412b-aec0-44aa1c89bf6e","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05450","last_updated":"2025-04-14T04:53:32Z","snapshot_observed_at":"2026-08-01T15:07:04.704348Z","submitted_at":"2025-02-08T05:01:17Z","title":"ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05450","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2502.05450","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:b5741df769618f1e45f8223e368e345b33f86a6cc94afc933836293a138f63a6","observation_id":"bc7eda4d-f748-434c-985a-f2d8f32aa19a","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01534","last_updated":"2024-05-02T17:59:31Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:59:31Z","title":"Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01534","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2405.01534","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:1aad31685c0e03e60f0d83994c75bddda0cc3cb315c498c6829f5131d52918ab","observation_id":"195496e1-79b7-473b-beae-810a615dee70","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07280","last_updated":"2023-03-13T16:54:11Z","snapshot_observed_at":"2026-07-06T15:02:45.127825Z","submitted_at":"2023-03-13T16:54:11Z","title":"Vision-Language Models as Success Detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07280","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2303.07280","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:d69bbc79ecacde54d608b534e3ac9caba3bdb593bdf70746b7ffcc2c34cc20f0","observation_id":"c249368a-f755-42bb-9682-bb3984fde106","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"Gemini 3 Pro Model Card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:bb2e292a8a2081aff706d6ddbcfeb61bbc8e09f8bda21c670784260bb82cb944","observation_id":"b8cfdf0c-b4b8-45e2-824f-3d59261c22db","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:c4d1e335ded51b8cc5f0d34d0d15241709ba722c66574b6f914434c6bb3ab4d1","observation_id":"5ec04593-5322-4cc8-aa79-1ea6192af76a","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:a3826e9a8e9e61364cb59b8a8d9df933e79575d617825dd67e28ddf29f5b5c82","observation_id":"c498d802-e594-43b6-bad9-edf44e82e018","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:8194b849d6897b208e30fecfc476ab865d8f6f5e49b9e9ebb627dd1a58bf5e2f","observation_id":"ac860e48-7b16-4106-9f8a-1ea66bde5243","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:61f955747889d432e06a734eb93a45192f1c0b6a483b58c5f13427addb655842","observation_id":"a8a96bbb-80b6-49fb-ba57-6ba6f5a515d8","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:2b7694f71f1592a02d58f7c762931950b857b85a6031f452837c03ba51711d8c","observation_id":"ba0b2f20-8946-4f9b-b859-3408db88f193","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"and Berg-Kirkpatrick, T","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:3f53a9fe2413f528f0ebc2aa839d66a79dc2ba196b942a6ac5a0f629f3791c19","observation_id":"7c10364a-a134-4915-bea2-4dc4370cfd46","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"J., Pertsch, K., Karamcheti, S., Xiao, T., Balakrishna, A., Nair, S., Rafailov, R., Foster, E., Lam, G., Sanketi, P., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:5482900117bdc484fdcf52a6de33b1fa16b507f9ee75536b58f48ef887fc4098","observation_id":"48594a0f-4176-4eaa-83a8-5351f2880570","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:887d3de1ce5e7db3407c3e7d5693bb0f545b7c513079ba3c76953e6f0e621f72","observation_id":"19de2312-eb00-4f82-9d85-e4152773d7cb","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:fa2d87af64e65284da4f8442a77404446ef23362b638f93f0ab2c76cc671869e","observation_id":"88914eb7-203c-4aac-817e-05a1b2e84b48","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:9b15d437b9613747f5aacfed1073bfed4c0d792f19bf349f7fa2fa559cf2c733","observation_id":"bcc89693-6875-479c-b6e3-e677596372cb","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:e9bf68e1ec0ae2f0f7520ad69cf9d6c142f51baa09f851c7eee9515b5388b0ff","observation_id":"f37521e2-0fbc-45b0-9a93-87fd0b3e23d7","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02115","last_updated":"2026-05-13T21:07:49Z","snapshot_observed_at":"2026-08-01T20:59:07.888539Z","submitted_at":"2026-03-02T17:38:58Z","title":"Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.02115","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"S., Zettlemoyer, L., Fox, D., et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2603.02115","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:c2f6e40ec8d6d8b6038df2efd8a062d73e23aceaeae77cbf5fe6b0ca4c14b8af","observation_id":"34e70e25-17e8-4609-9dcb-7ec131393ba1","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-07-31T17:40:45.057417Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:a7fe0e228144f9bdf39d812f4f2ad8d8c24d5ff3f26e7754726064cd8cb73fd8","observation_id":"af931e7b-966f-49d5-ae32-94e19f6246f7","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:c2e066ca9613f752008b4d9d8aefeaeee695b7881d2b4f4c87ee72e5d6957dd2","observation_id":"342f070f-c0a6-4305-b008-e204e5b415bb","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:54fe28d30fe8a4c16947390f7a24633c8254acc5627c90a52c87db360bbefce3","observation_id":"7baa9a60-b7cb-47c7-ae76-730587a39393","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"L., Berg, J., Sharma, A., Schaal, S., Finn, C., Gupta, A., and Levine, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:31467385f766f0163f714a49d7cfda1b0c220a89de951030c82907c0bf376deb","observation_id":"68425c62-3fa6-4362-aa6f-8e035412073a","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:23b2a85e6f4d612a50526c18bf032324784685847a5c6c586a862bfb20a9c801","observation_id":"c5b4e255-8cd4-44c7-b2db-b736049f7868","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:89071d1779848a0ed631c105f3d611d3c4f3e6b5fca0c5ebd6a707e2c8c3b81b","observation_id":"51f198e4-d4b5-4957-a463-d0b23162bab7","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12822","last_updated":"2025-06-15T12:05:08Z","snapshot_observed_at":"2026-07-06T21:42:30.134963Z","submitted_at":"2025-06-15T12:05:08Z","title":"Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12822","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"M., Lee, Y ., Lee, D., Kim, S., Kim, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2506.12822","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:17471687415d36db5a7fa1e4a3353748e2cc5394484d73961a3592f399aeb8ef","observation_id":"0e9d3458-f541-44cc-bb1f-2ae14dbf8d0c","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"J., Hejna, J., Fu, C., Shah, D., Liang, J., Xu, Z., Kirmani, S., Xu, P., Driess, D., Xiao, T., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:e663d38b29ea3536918f6005a48978665fbc9e52401975513b7c4866c6d8b026","observation_id":"81a86104-4936-48e4-a241-7236a7661ccb","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04549","last_updated":"2024-11-07T09:17:50Z","snapshot_observed_at":"2026-08-03T05:12:50.362667Z","submitted_at":"2024-11-07T09:17:50Z","title":"Vision Language Models are In-Context Value Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04549","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2411.04549","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:a90f96846f30cf051d7dcd7b0600f564df7b4efd6e3827a39174fd3a181b2a10","observation_id":"6d0827d1-adc2-4eab-bcd0-d3b0fc0e9b57","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"J., Kumar, V ., Zhang, A., Bastani, O., and Jayaraman, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:e91f8e5bda682307408023d5300ca0141d9cfe59ff4bd2b492e5bd149cd1353d","observation_id":"1af7843f-5822-4b11-b749-04224eecdc08","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"S., Gao, T., Sampaio, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:96ea2948725514ec0b2534e92b657c621987682b9737bfb4764d16624193dece","observation_id":"00521669-6dec-42f6-945a-8f2473994a8e","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20568","last_updated":"2024-09-30T17:59:50Z","snapshot_observed_at":"2026-07-06T19:24:43.745786Z","submitted_at":"2024-09-30T17:59:50Z","title":"Continuously Improving Mobile Manipulation with Autonomous Real-World RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20568","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2409.20568","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:55349c43edb0b0acb045245cc97a07999b53940bb4721749781f32a8509bc9f2","observation_id":"5880f5f0-3f52-4486-a046-4f97ab4df8ca","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13816","last_updated":"2025-02-24T21:05:58Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:46:26Z","title":"Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13816","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2410.13816","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:a91d5ce2d82c0e88dcea13ffd351d2f286a63b2092edfe529d9ab96a727d2336","observation_id":"5de3b609-1808-437b-a62d-46500b7d2574","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:2271d25b6a4a8f2c3beeefb83ba99dbc4029c93269e5a6065534bd11075ab6b6","observation_id":"451c0277-5997-4e89-aeab-2e8b5d7e67de","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"Y ., Harada, D., and Russell, S","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:4603135c62548a3ff42ba0c0fb750cd05909924482ee4117492b6e4d449b9dca","observation_id":"64cf7f14-e689-4011-b9e2-ba1b2b6d5818","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"L., Sanketi, P., Vuong, Q., Xiao, T., Sadigh, D., Finn, C., and Levine, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:7fe6b9565a60c70a5d2109040d12d14661809087e3a759fa6d3061ee4f4f9518","observation_id":"7eb8b812-ad1d-4715-ae8e-702283ff209b","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:799a894655d813a8be5e953250106c25a41aed952188f7175d5445d9f4d1d12f","observation_id":"08295e29-a059-4c83-962f-f8079be655bc","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"Spacethinker dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:c83873b22fd2ef6bca0cf908fc8527c19f580525902f38137d40b4f8f41bda35","observation_id":"c1316c06-19b0-47ea-afef-97cd8674b049","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:3eaf9034ce9fb92dadbd25d8b677d3704097e1df7a6c267bf71877e6ba83fafd","observation_id":"dc570533-9b5b-43b7-a841-9e82520f575a","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-05T09:19:33.671135Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:48772ae6aa3d3bb2f684992e171496f47c62cb5249ffbe24477a425e873aaea4","observation_id":"326ddb2c-398e-47b5-8d62-9041f74f5f33","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:deab585d0ce1b165a233fe448701d3353bad3de995c7c822e3d01c6f43580086","observation_id":"c52db252-dd66-4867-92a9-4d7c494d345f","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"K., Wu, Y ., and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:bc62ed8a4907b6bbbad0a19761dcf2ef84cb2bdb91cc98478dee7a80104a8e52","observation_id":"6c65d2ae-070b-4d36-8ce4-7cf974c484fd","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13817","last_updated":"2025-03-18T01:51:27Z","snapshot_observed_at":"2026-08-03T20:03:56.005155Z","submitted_at":"2025-03-18T01:51:27Z","title":"VARP: Reinforcement Learning from Vision-Language Model Feedback with Agent Regularized Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13817","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2503.13817","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:7d4473de37f20efe7cb0152fd46893852d3dc6569e1bde02ab4b66893e75f947","observation_id":"f568d937-7887-47af-bb6d-07833bd943e1","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:a4c5d858f2718c2d61774ff29b8a2e588507091c8d37c12b9c1702e04ec7ebf6","observation_id":"b108c7c0-ade0-40f9-857e-b866973cab5a","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:18ded407edf440932a6789212661ea2f6e1ba82f222ff46648682f726f36e2e9","observation_id":"001e821a-ec99-4940-a6d2-5d6b75be96af","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:653a3ae70feb0e2bdb6dd320f46cdd29dd28c0a9860d5ea70f604230cdfacca0","observation_id":"71b8a253-e382-444a-82bd-f86446f8b43c","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"I., Burnell, R., Bai, L., Gulati, A., Tanzer, G., Vincent, D., Pan, Z., Wang, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:2e55939d733026bed1e425bcb0132b3038921ddc989c1b9f9a20b89f39f85e3a","observation_id":"91189df2-b21b-4b71-b119-1d036bc5e6ac","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05273","last_updated":"2025-08-06T10:50:54Z","snapshot_observed_at":"2026-07-06T19:47:12.646290Z","submitted_at":"2024-11-08T02:12:34Z","title":"Real-World Offline Reinforcement Learning from Vision Language Model Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05273","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2411.05273","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:d2e3b4c01e9e65c3ed6ace9d565cd9a7245cfee0120646144d15c2ec9fc973da","observation_id":"ae592448-af17-411a-9e61-6674e22f573c","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04764","last_updated":"2024-02-07T11:27:45Z","snapshot_observed_at":"2026-07-06T17:26:47.184846Z","submitted_at":"2024-02-07T11:27:45Z","title":"Code as Reward: Empowering Reinforcement Learning with VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04764","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"N., Klissarov, M., Precup, D., Yang, S., and Anand, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2402.04764","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:1770f792a84bafc126ba618e549ed620a28b354101e759f678115db73c65e733","observation_id":"8e582b40-d12d-421b-8bb9-ac4cc3893c17","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15799","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2506.15799","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:77da29cabd0231b9f2ca10fdd3cf6420fb788c0044b4c9d36032e0fc96488bc7","observation_id":"6a8c27e3-8764-4a95-9a01-36ee6c1cc348","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:6aff3d966c1af2f67aadb459b53bc23bed06aba0301546ae41f574b978e53b7a","observation_id":"7db9bcd0-e23d-48d7-b94b-bf583e8e8325","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-02T19:29:16.535750Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:4bb06a7c5e6a537f66b3ff4587718c9e03ca1183670ef794fb642aac139324f4","observation_id":"b0f84f00-831b-4459-8c57-1980f1a76a1b","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:4a5f063596bdd2c2ceac33764efd39c54f01fc015b1a589fee344662abe5ffad","observation_id":"3031dd73-9c45-4839-aa60-fa3855aed234","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:9f79052e37879ee496d9959486fdd36fc8c716b5c0a6199879eda81588d658e5","observation_id":"033617b1-8153-48ca-9491-c069e6a8cd91","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21471","last_updated":"2026-05-07T07:59:46Z","snapshot_observed_at":"2026-08-02T23:27:20.204280Z","submitted_at":"2025-11-26T15:04:18Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21471","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2511.21471","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:4bb397306433817d1609d725712907bd7fb6f68791e48c7284bd60143a54fc1a","observation_id":"00749b07-771a-41d1-bdf4-5fc232c54668","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14735","last_updated":"2024-04-23T04:31:30Z","snapshot_observed_at":"2026-07-06T18:04:08.777507Z","submitted_at":"2024-04-23T04:31:30Z","title":"Rank2Reward: Learning Shaped Reward Functions from Passive Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14735","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2404.14735","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:2c1b1a8b7e2ee7523ffa719c9f841d55d9de6661f54644e14b78e951ac073cde","observation_id":"2d00360e-f8df-449a-ac97-4fe3418eca0d","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14872","last_updated":"2024-07-20T13:22:59Z","snapshot_observed_at":"2026-08-04T04:06:25.874501Z","submitted_at":"2024-07-20T13:22:59Z","title":"Adapt2Reward: Adapting Video-Language Models to Generalizable Robotic Rewards via Failure Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14872","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2407.14872","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:1ef8174cf725f067f7e087fe3514c6453d163173ce7717faaee087ebdca2eb6e","observation_id":"223277ad-c3a3-4dce-9c58-a67a02a08077","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:e967cc90aef3913cf2cd3aec6378d0a2e2127de5b1a267fe15c16ad02ad42968","observation_id":"04a77363-684b-4a62-bb6f-769c80e96f6f","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08548","last_updated":"2026-04-05T00:57:47Z","snapshot_observed_at":"2026-07-06T21:23:14.666121Z","submitted_at":"2025-05-13T13:20:46Z","title":"From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08548","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2505.08548","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:a648790fac8b56b274694b9ea2af9ae5e098c2ee468e39eaf19897fa9c63eb7e","observation_id":"95281469-68af-4221-a3e6-435307e72a7b","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-07-06T18:44:57.578408Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:56052e4fe294d3dd45ed31af6b174d242a6ea3d4152d9e590724dd38296059a7","observation_id":"391014b3-5fa1-4d9b-9f1e-4a2936501141","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:89b438ea49c7e0cc3c66b7e7ee3b7484c70238193269b144be6ad195fa53bfaf","observation_id":"61759c34-9b6a-41c9-83d3-d3a92d7212db","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:55a485dfc36e7b0d9a59f9a05ffe9defb8e4d12385fa87ae90a8e8372eeef583","observation_id":"26aefde6-bd9e-49d4-b247-8d3e204fef35","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"A., Lim, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:3d4be34e3e1450c60cf6ebce988c2d7a0be96dd66ed1a6864c7498b4e401438f","observation_id":"a2a8eb6e-c0ef-45a2-9704-62907eda66af","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"A., Lim, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:b7199c7b8df623e9051147fd678daa8404534b6f83a4e1794f24d4ee361ffdc0","observation_id":"1d8c31d4-55fa-42aa-a26e-d307f82e0179","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:217100fae0b6339517b85630c87ddf931d8dab2c996f67f4550142c9f5bb5661","observation_id":"90f2bd49-a0c0-4c77-93ee-3e95ab17149e","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:5e985290bdf5c7c15f0affcc5ffbc0b82b8dba92a629ffcf5d3b217224560391","observation_id":"904c8a16-d0a8-4b19-8bae-3e0284a62a0e","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"close drawer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:2c45fa779243ed4585d2a3ef8aac4538acd2755d61fdeca2dc9f5f3e79b703b7","observation_id":"f83b1ae3-17e5-4c8f-a1e6-5a4e5a693fd2","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"To prevent optimistic extrapolation and reward hacking, training data must include authentic non-expert behaviors spanning varying degrees of task completion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:14cf155bd66b5b9ca2804301d857dd5cb988bef942a32a5d7b35f41ea79dda0a","observation_id":"b32a9b70-1144-4ada-b084-601e50e53e42","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:b5e8f4983ccf3f871681fc8962ac465c9d50405e2d497fadf3ad7994a3ee900c","observation_id":"00fb0e76-b612-419d-9415-4527fe0e1fd3","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"near the handle","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:d9855e4160e15113c607754ed9c750b0347ce1590d6f4cf422edba5699d2748b","observation_id":"3a13f084-b3b9-4dfe-871e-f589391090c4","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T02:23:21.482031Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2603.28730."}