{"as_of":"2026-08-11T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96a171b0a4adaae148a9768070fcb29c5a3a467623600fa373f3108a27e7cd11","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T12:30:30.343964Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.24633/citation-record","integrity":"/paper/2606.24633/integrity","json":"/paper/2606.24633/citation-record.json","paper":"/paper/2606.24633"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"and Ng, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:046371a7558ed4a22fda41f105aa0d60b61a46b8a4e53f4aec0b0522a17c0b29","observation_id":"ace7589c-730d-456a-be09-383ed9a72a9e","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Video- language critic: Transferable reward functions for language-conditioned robotics.arXiv preprint arXiv:2405.19988, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:7fbe1637fd5f9a6c3903d3ea8b09cc6dcebf06381f8208329456823e8f18f99b","observation_id":"0c04440d-91ba-49a3-b6b4-2ca4814c94f8","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Z., Sharma, C., Shi, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:3e545bb5de70c64fd24160fbb8c9a86c564d0b33fbf4a796972f9ccb8480ddb8","observation_id":"0f09f7c4-0e16-4960-a2ed-22f23c9bfbd0","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:0aab9a1611c28f4c43de386729f3c2f9716feb7b5d77b1ff32b1f6a942c25938","observation_id":"97defe0d-ee31-48e0-bdb8-3d6284358b5d","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"X., Tanner, J., Vuong, Q., Walling, A., Wang, H., and Zhilinsky, U","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:ef6c13871338c43a2a14b34c8eb36362c4e42ba78b91f412bd11b8dcf60c9c38","observation_id":"d3850b1f-2ddd-486f-99d4-f315dc8c43fd","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:022e8beedb70609b7c7747b2fba89730f849e8face77ddde0c5dcb193ac205eb","observation_id":"7892df81-7c3a-49ce-8bd4-800c375b701c","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"G., Gopalakrishnan, K., Han, K., Hausman, K., Herzog, A., Hsu, J., Ichter, B., Irpan, A., Joshi, N., Julian, R., Kalashnikov, D., Kuang, Y., Leal, I., Lee, L., Lee, T.-W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:ef69cff3d73f9b08f981e095f9a05dd7587422ebe08cf20e0299148445fd2463","observation_id":"a43d8a70-d384-4b7a-97ed-7f5998e65674","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:d1bc62b8e78a60429620ba0c249a1719e7b68633fad226d2c0f0b5b34e5733b2","observation_id":"706630a9-4bd6-43b4-80f8-7e5330057c1a","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"S., Goo, W., Nagarajan, P ., and Niekum, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:5a3ad48a9541e3f631b5f77a1c50fcb86124745274c2128287bca0c0bbb2dc9c","observation_id":"5686a67d-fa47-42f9-bece-556852ed2576","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"S., Goo, W., and Niekum, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:bc1b6414e76ebefc8dfc41c0320e60362d80d328503e8bae9a8c8ca103435927","observation_id":"bfd25655-aa02-463b-a041-36b7eda252d1","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:4b25849ec68aad8fe38b19d42e99e933fc17514da56031343d7c49eba30c9dce","observation_id":"eb3bf747-7bf2-4589-ba75-8c70f5dbffe7","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"in-the-wild","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:2867d39bb0c39546d2958c29cf8b840d4ef8adf75e511776c0d58a949ff3e436","observation_id":"92c95d16-81dc-4f75-a65a-5b39f35f5938","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25358","last_updated":"2026-04-27T02:56:51Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T18:07:54Z","title":"SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25358","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Sarm: Stage-aware reward modeling for long horizon robot manipulation.arXiv preprint arXiv:2509.25358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2509.25358","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:9be2d60783f79f3e213799e9a831045b3f02055fa7494fd9a8400d778815b693","observation_id":"11c85dd2-be5a-40b3-8777-b7cf0a266560","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"J., Ren, Z., Ratliff, L","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:a23a977f228275497a0afadcb22f556ed85182c8a1de704878a4a6798c7bdea6","observation_id":"52ef0489-4b15-48e6-9672-7e7f09a30710","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"villa-x: Enhancing latent action modeling in vision-language-action models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:0429b95dc1e4027036c579725822a77d78518d9b46d43b9b594def6d4a4b35f1","observation_id":"dd2906fa-6342-47e8-b223-603786c674e7","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23682","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2507.23682","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:bb90bce2c77cfe27674f47c2346ad54d0ee8b3d2169d3e9d0576510af399b1c8","observation_id":"1a01366b-5cef-4dd4-a157-9cd3764d51c8","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:f9a752fe6f022d5f1cdd45cd24ac26b5dd8a6690e828311c638bd8f8861da9a6","observation_id":"5d0437b3-b89d-4eb6-ad0e-bab2f0f17ae5","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"F., Leike, J., Brown, T","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:ef51a7bd2437aeb9cea0c19fc1b89c41fb618011c0db1cad766946697a59c09d","observation_id":"c1eea95e-ef41-4908-82f1-6199a4c0d6f4","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Guided cost learning: Deep inverse optimal control via policy optimization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:3e211c06218856030863839cc23db36e1d919e7e53186705b0521f9d6481ded5","observation_id":"5e4bca3d-8cc9-49ba-9d02-18afe07802ac","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Awr: Adaptive weighting regression for 3d hand pose estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:cd5b8c65e7fa3b23222e9a0b8f26c6501e821e03cd0a78d24782522dafdec9b1","observation_id":"2c2097b0-5df5-4119-8f04-d7d547b11ed2","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Y., Ghosh, D., Groom, L., Hausman, K., Ichter, B., Jakubczak, S., Jones, T., Ke, L., LeBlanc, D., Levine, S., Li-Bell, A., Mothukuri, M., Nair, S., Pertsch, K., Ren, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:36a440466a7ae57d24cf29ef1169586afdcec4f56c1345951342791fc4876a61","observation_id":"656a11d9-4747-4d47-bd46-94c13a3535d6","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-07T13:44:24.778030Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Vima: General robot manipulation with multimodal prompts, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:55f33249515819450896520a1a7a90aef044cfdde5062945cde2b5e93cd54f4a","observation_id":"d80ff42a-9493-4239-b43f-01db1f169ef7","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:4e16f46976becae8769dd23de07ba15d521c55913eca79bb87d354b4cf232cfa","observation_id":"125d4e37-966a-4bd5-af77-4c2bd580b06e","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Demodice: Offline imitation learning with supplementary imperfect demonstrations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:cb9e26d0cb538ba865c71c649d1e4adf77007ecb155e314cb409197c788504a4","observation_id":"2b63f625-0be3-4fbd-aeb7-6a80a701323b","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:da3e3d87501876825dd4e39991804f941216beb48a1ecdf41cee869e76ecbe2a","observation_id":"09e5c63b-d132-4748-86fb-d415e3fabde3","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09327","last_updated":"2017-10-18T03:52:18Z","snapshot_observed_at":"2026-08-09T23:45:15.176777Z","submitted_at":"2017-03-27T22:26:16Z","title":"DART: Noise Injection for Robust Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.09327","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Dart: Noise injection for robust imitation learning, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/1703.09327","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:86977d35ab72a7607e8cc3ba47a1b8c67b4bbae3492d66567184072462297e6c","observation_id":"161cf680-1135-4ec1-a8ff-567063c259d3","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Roboreward: General- purpose vision-language reward models for robotics.arXiv preprint arXiv:2601.00675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:2ea559bb23ce677ec51cebfad64b7abb1bc85ab8065ffa032ddda74078d58bc1","observation_id":"7ce8d7b1-8dab-4563-93ae-811f2113bbc2","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Bridgevla: Input-output alignment for efficient 3d manipulation learning with vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:e24f27ce79c0d79cc90b1dc5dc2fcd054651610a2df4cfdd31543e1480098865","observation_id":"7a3258de-2525-4a15-9e57-d0506bcccfad","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Gr-rl: Going dexterous and precise for long-horizon robotic manipulation.arXiv preprint arXiv:2512.01801, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:152ddc7e924def1249311e217a985aa71debc78141f0985eccb77103102a9e8c","observation_id":"79fae587-cfd9-4504-8db6-2cc2ee36ce3b","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02115","last_updated":"2026-05-13T21:07:49Z","snapshot_observed_at":"2026-08-01T20:59:07.888539Z","submitted_at":"2026-03-02T17:38:58Z","title":"Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.02115","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"S., Zettlemoyer, L., Fox, D., Xiang, Y., Li, A., Bobu, A., Gupta, A., Tu, S., Biyik, E., and Zhang, J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2603.02115","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:baeb423d3bd3674900a0c10b6279a1398720e2e3b5be8407338e4ba43c9b7489","observation_id":"54d95685-0b36-433b-831b-7a183e34f551","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation.arXiv preprint arXiv:2410.07864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:ffae9713a9e92601a57574336e47f535ed1a15e0df53bb205e5469b6b729c6b4","observation_id":"0ac7198c-b9ac-4522-8439-cbab5e3b4681","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-11T15:42:16.204049Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"J., Sodhani, S., Jayaraman, D., Bastani, O., Kumar, V ., and Zhang, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:65a2a6ddbf4f97a7e95aeee2fa8f9b8c8a507f338c380a86460b13fa39c9802d","observation_id":"00d8c645-ad61-4659-89ef-ac542031fa31","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"J., Liang, W., Som, V ., Kumar, V ., Zhang, A., Bastani, O., and Jayaraman, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:30834b9fcf1c15249a9224582603fe26b9f796ce005ede50fab3c1165fa27915","observation_id":"5f290982-b9b1-43db-8e04-e1be75755d7e","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03037","last_updated":"2026-04-21T06:50:49Z","snapshot_observed_at":"2026-08-11T10:44:21.654559Z","submitted_at":"2026-04-03T13:45:59Z","title":"ARM: Advantage Reward Modeling for Long-Horizon Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03037","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Arm: Advantage reward modeling for long-horizon manipulation.arXiv preprint arXiv:2604.03037, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2604.03037","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:b312a6074a7e3fa4bc370172ddf6a5c0cbab42938913774fa7f532c19c1c39f4","observation_id":"49ae4da6-514f-4de5-a04c-4e9af9525754","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Awac: Accelerating online reinforcement learning with offline datasets, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:a9bd63c2bce3e23d97e0caa7366472aebd36bbfae884043f99c29ff753a015fd","observation_id":"59290d0f-9db2-4cf9-9fdc-ec9e6e8f2570","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:bded39990a6ca9386ab6c53d4aa0730d8be16b81b59733f48b1d06539d0bd9ab","observation_id":"3e50c19c-a1bd-4263-b8bd-f2819d3eb9a4","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"C., Shevchuk, G., and Sadigh, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:7e2acab36120acf0a02273dff4cefff10c727f50f8f9c9f556ddef6c39e0079e","observation_id":"33927d87-2415-4034-be0f-bffaf3d99703","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"B., Kumar, A., Zhang, G., and Levine, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:85c5dccfe14b630a9d6ae16965eccf44c3b7e0e8224c136eca1f5b2002f8c293","observation_id":"314d1b5d-376b-4f9d-89d3-7c8f5b5005b6","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"D., Sastry, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:98acc8c549576c72887c32353d8bdc41aec099ca258885d0adc28b6e9a7dcf73","observation_id":"89e0a031-5eb3-40b8-8130-90ab90743394","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Smolvla: A vision-language-action model for affordable and efficient robotics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:44f54d70e3782f573e7f3c196027bc9dad428fc945906d16dd94ac9ff7624195","observation_id":"c0f0e566-7447-4899-a7e8-860a8471c2b0","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Robo- dopamine: General process reward modeling for high-precision robotic manipulation.arXiv preprint arXiv:2512.23703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:0331193dbb82a90e6dbbab61424822a0d1750cf8460ab74a9b1e32243fc0860e","observation_id":"802b361c-610c-4bbf-b581-dea9e2abbe77","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"M., Ghosh, D., Walke, H., Pertsch, K., Black, K., Mees, O., Dasari, S., Hejna, J., Kreiman, T., Xu, C., Luo, J., Tan, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:c389d9832e9eaa41e5aac5c4e06a5b4498d5f46f74ea144a150826895a5fe28c","observation_id":"a1f57171-794d-4ad8-89f6-de15535d2472","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control.arXiv preprint arXiv:2502.05855, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:e99dca973069f2bb8e39823e2de44d340c0525c49d094ba180cab502aad9b03c","observation_id":"4d6aa5ce-235d-4267-a8e8-747698a5f2d0","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.09387","last_updated":"2019-01-30T01:43:01Z","snapshot_observed_at":"2026-07-06T07:29:17.877464Z","submitted_at":"2019-01-27T14:42:53Z","title":"Imitation Learning from Imperfect Demonstration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.09387","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Imitation learning from imperfect demonstration, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/1901.09387","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:fff23babd4234764e2be0478b1253d8045beeb9d7395eb1debff6f42e257ad61","observation_id":"3eded503-c32d-4c40-8245-d6d42669d4e3","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Imitation learning from imperfect demonstration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:01146f6b82819bd130859b18179464122f9cc3e834ececc9b16950c334b5ae00","observation_id":"533c2f52-62c8-42e2-a976-2c3a929bb956","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Discriminator-weighted offline imitation learning from suboptimal demonstrations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:27fda3673080721e560b33b51f22ec18606e40c93e77c554415d19984364cddd","observation_id":"a7d71092-d6b9-487d-9ea9-582477c9e2a3","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Compliant residual dagger: Improving real-world contact- rich manipulation with human corrections.Advances in Neural Information Processing Systems, 38: 139559–139581, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:2365a066a446349361e89b3f9d3795b1e607c81e9560c1d6bcb371ac56827fd6","observation_id":"336a06ef-28e6-42a1-a98e-397e5012b31c","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11075","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Rise: Self-improving robot policy with compositional world model.arXiv preprint arXiv:2602.11075, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2602.11075","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:bbdb35d43e2fa5b13f6b8a87caae065b17ddb3acc952601ee345365a5858ccb5","observation_id":"aac45401-531f-4b8a-87de-33b212ec2d1e","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12691","last_updated":"2026-06-20T06:22:27Z","snapshot_observed_at":"2026-08-10T13:21:27.622941Z","submitted_at":"2026-02-13T07:46:37Z","title":"ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12691","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Aloe: Action-level off-policy evaluation for vision-language-action model post-training.arXiv preprint arXiv:2602.12691, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2602.12691","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:4ad1dea012b381f68a0c45735a2186f804deccf4cd7ffc85040e4c4b20e3c41d","observation_id":"b02d2d26-146d-4627-b0b8-80a66061f62d","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Confidence-aware imitation learning from demonstrations with varying optimality","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:9cc9790a61306fcc80ab15923d3e6be638b551da2dfe5b8be9c7c0dcedaeb37d","observation_id":"5b1fb27c-0926-49bd-9336-684ff68f7f8e","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13508","last_updated":"2025-02-21T07:01:56Z","snapshot_observed_at":"2026-08-07T18:06:23.081376Z","submitted_at":"2025-02-19T07:53:45Z","title":"VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13508","snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"Vlas: Vision-language- action model with speech instructions for customized robot manipulation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"cited_paper":"/paper/2502.13508","citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:d8299a954de907f19ed3a7376558219cb73bfd56465cb84e0db0977d34412812","observation_id":"d0f4b36f-b5a1-4bcb-ae7a-03fd37fc19de","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T12:30:30.343964Z","title":"D., Maas, A","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T12:30:30.343964Z"},"links":{"citing_paper":"/paper/2606.24633"},"observation_digest":"sha256:cd2a87a4494b48379cfad0f86b435c1e82208dc250f04c127861664f54ece101","observation_id":"ea73a968-811c-4fbc-97ba-44d9d0ebfa8b","resolution":{"observed_at":"2026-07-12T12:30:30.343964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.24633","last_updated":"2026-07-06T03:43:15Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T18:04:44.206246Z","submitted_at":"2026-06-23T14:27:10Z","title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2606.24633."}