{"as_of":"2026-08-13T01:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22acae9a69e48f80fa9ddda82389f28f4e30b490ae6a0e3bd626d22c79f8fd0f","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T12:17:09.473142Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T22:11:44.933463Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T21:00:09.861752Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"cited_work":{"arxiv_id":"2606.06491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.06491","snapshot_observed_at":"2026-07-04T21:00:09.861752Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","venue":"cs.RO","work_id":"34aa63b4-bfac-4a26-8c5d-ba4777b7e7ba","year":2026},"citing_paper":{"arxiv_id":"2606.26095","last_updated":"2026-06-24T17:59:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-24T17:59:56Z","title":"Learning Action Priors for Cross-embodiment Robot Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-25T19:09:56.409766Z"},"links":{"cited_paper":"/paper/2606.06491","citing_paper":"/paper/2606.26095"},"observation_digest":"sha256:8823d9ceffe3d82e509dfdeca60bb78fe630b13b1a70db19c4322a458fd73aa2","observation_id":"18e184dd-d598-47b1-bbd2-41f09985f8c4","resolution":{"observed_at":"2026-07-04T21:00:09.866499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"cited_work":{"arxiv_id":"2606.06491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.06491","snapshot_observed_at":"2026-07-04T21:00:09.861752Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","venue":"cs.RO","work_id":"34aa63b4-bfac-4a26-8c5d-ba4777b7e7ba","year":2026},"citing_paper":{"arxiv_id":"2606.31654","last_updated":"2026-07-02T11:38:15Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T13:33:48Z","title":"DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T05:35:32.213470Z"},"links":{"cited_paper":"/paper/2606.06491","citing_paper":"/paper/2606.31654"},"observation_digest":"sha256:98fefe029df6bdf21bda13bdedd7ea85736436da24eade2503d8bf249640ea52","observation_id":"9fd92054-4b66-482f-8ed4-b9e0b3d9851c","resolution":{"observed_at":"2026-07-01T10:25:41.236456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"cited_work":{"arxiv_id":"2606.06491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.06491","snapshot_observed_at":"2026-07-04T21:00:09.861752Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","venue":"cs.RO","work_id":"34aa63b4-bfac-4a26-8c5d-ba4777b7e7ba","year":2026},"citing_paper":{"arxiv_id":"2606.31654","last_updated":"2026-07-02T11:38:15Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T13:33:48Z","title":"DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-03T22:11:44.933463Z"},"links":{"cited_paper":"/paper/2606.06491","citing_paper":"/paper/2606.31654"},"observation_digest":"sha256:f82b74d56b6ee1b5b76493a9cfc590d9aa112a0a03619e8e735dc9d1fe031939","observation_id":"136ec0f7-52c9-460f-b0b6-c82e7237645b","resolution":{"observed_at":"2026-07-03T22:18:59.691908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.06491/citation-record","integrity":"/paper/2606.06491/integrity","json":"/paper/2606.06491/citation-record.json","paper":"/paper/2606.06491"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-02T12:17:08.910697Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:08.910697Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:3795154a253aa224c8e4a404e038d5eeb962cdde37f8166b0b7327f947976d3e","observation_id":"a4abae44-d9dc-45a9-936a-62ce0b335cb3","resolution":{"observed_at":"2026-08-02T12:17:08.910697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T12:17:09.006954Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.006954Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:5d3655931eb8adacbd474cb0e59f08612c51a1067594f349d51963f8abe4f957","observation_id":"a8e16c0e-2d54-46e0-9277-f753fb879227","resolution":{"observed_at":"2026-08-02T12:17:09.006954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T12:17:09.115024Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.115024Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:b984e3f7a4a172e794fee792e724ce39f9f1cc4f740bb6df25079420a372969c","observation_id":"41038dcb-d46c-4b6f-9d4f-cf514a30e2e9","resolution":{"observed_at":"2026-08-02T12:17:09.115024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T12:17:09.233393Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.233393Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:f488f6c8e0c5747045d268d552ce723711bb807a760a31997c015b93f50fc419","observation_id":"8f60dadd-8cee-4770-9316-5d1f715c134c","resolution":{"observed_at":"2026-08-02T12:17:09.233393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T12:17:09.281045Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.281045Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:610caac4047bcd12eaee2dd535f756bea550ba875a775b74c3edc93f60aa3e91","observation_id":"f560f064-e539-4ced-a933-f68d18c14bdc","resolution":{"observed_at":"2026-08-02T12:17:09.281045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.285133Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.285133Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:8e2f805cd481e4d9a2e21078d27eaf5af9dccccfec34afac6145431c40378e1f","observation_id":"e021d169-e421-45e3-a6c2-ab80272bbba2","resolution":{"observed_at":"2026-08-02T12:17:09.285133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-02T12:17:09.289300Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.289300Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:2e1e2ddc9f8ceec0b2faf6aac330656204c9052c0cff4d57448cb0e03186df76","observation_id":"b8941ab7-77ba-407a-9fac-606ec2cf9f40","resolution":{"observed_at":"2026-08-02T12:17:09.289300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-02T12:17:09.293003Z","title":"Shukor, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.293003Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:bd9c209cc0158b1dae11dc5c2bdaf009160c605b1b5f6daa74f0c259b7854c17","observation_id":"9f91fcdb-218c-4e91-9331-9c575a4932a5","resolution":{"observed_at":"2026-08-02T12:17:09.293003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-02T12:17:09.296034Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.296034Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:6b04ee0a983afc1d6f866d8c801e76b3fce40560231cc00e440221cf4971a445","observation_id":"99897dc2-d26b-4804-b5bb-6887768d813a","resolution":{"observed_at":"2026-08-02T12:17:09.296034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T12:17:09.299864Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.299864Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:b3454ff30b8fce51147d769bde8a384888c2d701e380b20f65682724a5cf404d","observation_id":"1b88cc64-644c-466a-a2ec-b77caf6dfe87","resolution":{"observed_at":"2026-08-02T12:17:09.299864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-02T12:17:09.302822Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.302822Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:3802ebb4383922394532de8c6766580a9b5aea2c6ccdd9a209723554064a93ef","observation_id":"a8e457c2-4b75-441c-80c7-83b7924145ff","resolution":{"observed_at":"2026-08-02T12:17:09.302822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07339","snapshot_observed_at":"2026-08-02T12:17:09.306544Z","title":"Black, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.306544Z"},"links":{"cited_paper":"/paper/2506.07339","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:30df195446209c7ff143b7351808c077e98b51474a54fa22523eb59fd93f8893","observation_id":"9440b441-8645-4b6f-b29b-a05e6e854623","resolution":{"observed_at":"2026-08-02T12:17:09.306544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12978","last_updated":"2026-05-17T13:09:20Z","snapshot_observed_at":"2026-08-05T03:16:35.662407Z","submitted_at":"2026-02-13T14:56:06Z","title":"Learning Native Continuation for Action Chunking Flow Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12978","snapshot_observed_at":"2026-08-02T12:17:09.309503Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.309503Z"},"links":{"cited_paper":"/paper/2602.12978","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:bd610e89423581a320ec2763da51fedd3cd233c14604de995adf2c851c12aec0","observation_id":"b49a46ab-ef29-4e94-b746-b4dbb1db7b8d","resolution":{"observed_at":"2026-08-02T12:17:09.309503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.312594Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.312594Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:a26b60811954bc810aadd4eb9b0c74dc1391b508e0610e76e48f44916929a906","observation_id":"0d32b777-db7c-44a7-8858-e48bc7c68e3e","resolution":{"observed_at":"2026-08-02T12:17:09.312594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.316110Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.316110Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:5c704ab960d4c550d4defae0906bacda42b6724b20d268e06a430e4ceced39bf","observation_id":"2ae9e9dc-f574-4894-b4f9-cb50f5acae31","resolution":{"observed_at":"2026-08-02T12:17:09.316110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.319732Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.319732Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:d3b3257b29727a7dc7079a3d01327c26de9a3cf9eb9bc693bb1aacd7d0ab9b95","observation_id":"f3694867-a38e-4509-a6ea-95ec9217056c","resolution":{"observed_at":"2026-08-02T12:17:09.319732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25661","last_updated":"2026-04-07T08:13:17Z","snapshot_observed_at":"2026-08-12T19:27:01.496322Z","submitted_at":"2026-03-26T17:14:57Z","title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25661","snapshot_observed_at":"2026-08-02T12:17:09.323563Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.323563Z"},"links":{"cited_paper":"/paper/2603.25661","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:ce28387ae189286c007138fb03d3d810f0dc8d1e926400e092d7d9c2bdb1d4b1","observation_id":"5fb364ff-2a46-44fc-943a-02f040aed1f7","resolution":{"observed_at":"2026-08-02T12:17:09.323563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16981","last_updated":"2024-11-13T02:49:58Z","snapshot_observed_at":"2026-08-12T22:17:36.536875Z","submitted_at":"2024-10-22T13:01:21Z","title":"Proleptic Temporal Ensemble for Improving the Speed of Robot Tasks Generated by Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16981","snapshot_observed_at":"2026-08-02T12:17:09.326918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.326918Z"},"links":{"cited_paper":"/paper/2410.16981","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:b43ffbac9e6a3862844f818a6d461ce6719f79228ca7ce6dd19031b21787e471","observation_id":"e0ad80d6-03bd-486a-b578-beb5979f78ff","resolution":{"observed_at":"2026-08-02T12:17:09.326918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.330154Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.330154Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:83c1d802e4b86755763fc7ab309ed69a1a148bf70988482d666726ac80ca88dc","observation_id":"5e3e3ca4-bc7d-4d0b-bb66-2f88516a9a09","resolution":{"observed_at":"2026-08-02T12:17:09.330154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T12:17:09.333117Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.333117Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:2f865c5dddd6edf9302318e8b81672b9000ccb47b2fdae1e55b783570da9cc37","observation_id":"6ae20fcf-bcb1-47c0-9ef7-73ed0f6f00ba","resolution":{"observed_at":"2026-08-02T12:17:09.333117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-02T12:17:09.336409Z","title":"Driess, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.336409Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:7cb2a1eede45337e8811f0f46942de00eae8df69f1e69533f3c09f0defec54d8","observation_id":"cdc98a7c-8a4d-4da5-9f7a-269cc2dde502","resolution":{"observed_at":"2026-08-02T12:17:09.336409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-07T13:44:24.778030Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-02T12:17:09.340070Z","title":"Jiang, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.340070Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:1a82aca80be127ff3e36e20b8e8329649740c524895dacfc9f615725024405a0","observation_id":"3dc51200-c9f2-413f-8a87-55a5f5da7931","resolution":{"observed_at":"2026-08-02T12:17:09.340070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-02T12:17:09.343828Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.343828Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:8e44312c8b5dbfd3ff32414eee626ee136257328e42cd1d7520466c8e4568f3e","observation_id":"302da2d7-1482-4fc6-b5bc-a92026effb46","resolution":{"observed_at":"2026-08-02T12:17:09.343828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07539","last_updated":"2024-07-16T20:20:07Z","snapshot_observed_at":"2026-08-12T23:45:15.746549Z","submitted_at":"2024-06-11T17:58:54Z","title":"BAKU: An Efficient Transformer for Multi-Task Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07539","snapshot_observed_at":"2026-08-02T12:17:09.347507Z","title":"Haldar, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.347507Z"},"links":{"cited_paper":"/paper/2406.07539","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:65f7b0c0b43e916df42270cbbf9476ed0f49d05b04a0603da119171af4938431","observation_id":"5df08d29-d431-45bc-8ee6-8af5b5c04e60","resolution":{"observed_at":"2026-08-02T12:17:09.347507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11706","last_updated":"2023-12-22T13:55:42Z","snapshot_observed_at":"2026-08-09T11:58:54.163697Z","submitted_at":"2023-06-20T17:35:20Z","title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11706","snapshot_observed_at":"2026-08-02T12:17:09.351012Z","title":"Bousmalis, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.351012Z"},"links":{"cited_paper":"/paper/2306.11706","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:205b36e0639511e0e9299403a3bbbdf82bddae3ae21c7fcb2151aaa75e6680ad","observation_id":"065d3755-8d7c-4daa-9448-15a7cd8314c5","resolution":{"observed_at":"2026-08-02T12:17:09.351012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-02T12:17:09.354073Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.354073Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:f21aed51551cf69d9011338a200091b4efa122404ad9f4c3d2b4a91a85373c6d","observation_id":"c5f03691-54d6-4dee-a2c7-8f5830f3f92b","resolution":{"observed_at":"2026-08-02T12:17:09.354073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-02T12:17:09.358024Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.358024Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:8ba683dae8b810d295344aaedfcd8cd8c41297072b66a9edf7e4e7873deb1830","observation_id":"3f593424-15bd-4a15-b4d3-ddb1766866a9","resolution":{"observed_at":"2026-08-02T12:17:09.358024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-02T12:17:09.361587Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.361587Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:1aba49308ad0a92e6090fc53714f91a156ca7e06918baac589a1a92542d7e7a8","observation_id":"4beadd08-03b9-48a8-8956-f67b23ac9b3c","resolution":{"observed_at":"2026-08-02T12:17:09.361587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-02T12:17:09.364813Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.364813Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:f87499c894fd080884db39c2b31f7c39e8154809c32656d9752ee52f57c6cea4","observation_id":"9c41f296-1534-44a1-b4c8-9573c5c4de20","resolution":{"observed_at":"2026-08-02T12:17:09.364813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-08-02T12:17:09.368177Z","title":"Cheang, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.368177Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:47f823a631296e21459bde85f3864b42643aff07049548090cee585df1383c71","observation_id":"1f7a4c4a-31e4-46f6-9401-ce9a00ccd9a6","resolution":{"observed_at":"2026-08-02T12:17:09.368177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T12:17:09.371479Z","title":"Bjorck, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.371479Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:79f8742425f4462f08657c7593b13c5a060a1ad6b43541858f8f55c772cdf187","observation_id":"0495c715-6243-40b4-a721-4069844b3307","resolution":{"observed_at":"2026-08-02T12:17:09.371479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-02T12:17:09.375130Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.375130Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:f7cb094e7d91b176e20212fe64190c72b63e4326ae013423af76b69b770d9b40","observation_id":"a797346c-8c56-4d7e-9527-f0c21650c2f3","resolution":{"observed_at":"2026-08-02T12:17:09.375130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-08-11T15:30:01.335662Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-02T12:17:09.378283Z","title":"Zheng, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.378283Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:75a66ec0da9e675302893f50d757b720795259e32b021f06d781f65f80b5aab3","observation_id":"9d64a1ea-cc01-4fac-9513-6ba2d13b4c2f","resolution":{"observed_at":"2026-08-02T12:17:09.378283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.381942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.381942Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:40615145eae09056565d6fc0bf27c7a97d710235512645898f949aa97d944da0","observation_id":"9dee57a7-0c35-4a39-86e7-696d1200e477","resolution":{"observed_at":"2026-08-02T12:17:09.381942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-08-11T13:37:09.952888Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-08-02T12:17:09.385525Z","title":"StarVLA: A lego-like codebase for vision-language-action model de- veloping.arXiv preprint arXiv:2604.05014, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.385525Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:6d6d16e2aba92937f6992586c4dfebae03931909b00ac6b99ffa530de6550d5f","observation_id":"74131f60-2f2c-4aa9-ad83-132151bc7711","resolution":{"observed_at":"2026-08-02T12:17:09.385525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19433","last_updated":"2026-05-29T16:37:52Z","snapshot_observed_at":"2026-08-08T17:47:52.404594Z","submitted_at":"2025-11-24T18:59:51Z","title":"Mixture of Horizons in Action Chunking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19433","snapshot_observed_at":"2026-08-02T12:17:09.389487Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.389487Z"},"links":{"cited_paper":"/paper/2511.19433","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:be57f8fcf9392b880e7703554abf2f4dc65960e73b6ea40e3806e1d38b0e2f46","observation_id":"2209a340-2331-4e7f-95b7-97196d80c9a0","resolution":{"observed_at":"2026-08-02T12:17:09.389487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-11T05:34:32.208314Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-02T12:17:09.393479Z","title":"Padalkar, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.393479Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:e521679bef6bd01f634c36e2ca843b9e23eaffdf0cb4e48686c166e7cbeedd37","observation_id":"db70c79b-a9bf-4671-83bb-8efab937aa55","resolution":{"observed_at":"2026-08-02T12:17:09.393479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-02T12:17:09.397060Z","title":"Khazatsky, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.397060Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:bbf60ddc30ec3fa4a8aaa30e5c3f41e0a41a02d68016550eb07127674127ec98","observation_id":"d1e7101c-68a4-4145-b0f3-7c9bb2e624b4","resolution":{"observed_at":"2026-08-02T12:17:09.397060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.400324Z","title":"Walke, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.400324Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:a011f273457d20e8aab0893a70ac8083c6737cb5d56b190c7e63a860e265d695","observation_id":"091c780f-e4cf-4183-83de-ecbec7d808f2","resolution":{"observed_at":"2026-08-02T12:17:09.400324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.403011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.403011Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:7d0f248661d514887cef4d7b319cfd64f7baad2e6989445e0cea5510f9ee9790","observation_id":"ca7eaa8b-9757-439b-9dcb-1a4c748d4e41","resolution":{"observed_at":"2026-08-02T12:17:09.403011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-02T12:17:09.406198Z","title":"Mandlekar, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.406198Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:c8c8cfbcbd02f53f4e8a520b6674f0a7508166c8b570d03408e134291a395136","observation_id":"501ca900-b7c2-4cb8-88ff-85e68ec8a944","resolution":{"observed_at":"2026-08-02T12:17:09.406198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.410166Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.410166Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:d341202701576e5842339ba67c9d0027fef9bb2985c38ffb74110c5240c9a1b7","observation_id":"1082bd9f-37ca-48c7-a777-7e6b73a0ec9f","resolution":{"observed_at":"2026-08-02T12:17:09.410166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.413582Z","title":"Mandlekar, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.413582Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:a9608084d9fc9f0e498f29666bcabf571094b88c2fbc1500a917081e7e77e8cc","observation_id":"169f0f5a-9b15-488a-839a-80c9232e579d","resolution":{"observed_at":"2026-08-02T12:17:09.413582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.417140Z","title":"Dasari, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.417140Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:db4351baf7d57bbf96d7b4d0a7e2afce8443071205b9862d28985b8868123376","observation_id":"322a2301-a96b-4aa2-8553-718266d196ec","resolution":{"observed_at":"2026-08-02T12:17:09.417140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12271","last_updated":"2019-09-26T17:26:18Z","snapshot_observed_at":"2026-07-06T08:24:58.301676Z","submitted_at":"2019-09-26T17:26:18Z","title":"RLBench: The Robot Learning Benchmark & Learning Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12271","snapshot_observed_at":"2026-08-02T12:17:09.420240Z","title":"James, Z","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.420240Z"},"links":{"cited_paper":"/paper/1909.12271","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:12c39eff422dbe0853a21a817a37d3b48c5d4f322fc3bde555c8bf99d6d23d1e","observation_id":"df314f4e-5f2c-4ab5-a2c1-3e61f592a571","resolution":{"observed_at":"2026-08-02T12:17:09.420240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.424094Z","title":"Nasiriany, S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.424094Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:4a62fc6d8c6b794dc84b09e867751593e0547e6332db230326f0ef95df554bd8","observation_id":"35059fe4-ff25-45ad-9ca4-5543ece8d0b2","resolution":{"observed_at":"2026-08-02T12:17:09.424094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-02T12:17:09.426918Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.426918Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:4583ecd4ba43daf252ca83f0c3f01a081dbfca37b36118653ab0d0462d6e46bd","observation_id":"d285f6e4-47c6-4d18-a268-2978ba12da0d","resolution":{"observed_at":"2026-08-02T12:17:09.426918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.430128Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.430128Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:f5a64056bfdc6055ccfca26e093b93bf197f675b3a5cd26961158025a0f2a6b9","observation_id":"3d7f3d31-30e1-48f0-a526-c5f365d53481","resolution":{"observed_at":"2026-08-02T12:17:09.430128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.433679Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.433679Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:39cbb1a84991fd0c40d64d0ac823fca1ddec299c29421e6cd7ee0943f692bd8d","observation_id":"fa704825-c07c-4844-95a1-14d68d22ffdf","resolution":{"observed_at":"2026-08-02T12:17:09.433679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13126","last_updated":"2024-10-17T01:29:49Z","snapshot_observed_at":"2026-08-12T22:21:23.626518Z","submitted_at":"2024-10-17T01:29:49Z","title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13126","snapshot_observed_at":"2026-08-02T12:17:09.436948Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.436948Z"},"links":{"cited_paper":"/paper/2410.13126","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:20f1c0415b2ae4cc30f7f301367dda7ae9f6021467efca1d6f38cd49f615d74a","observation_id":"7c0baa2a-f126-4e03-b663-b08796880c34","resolution":{"observed_at":"2026-08-02T12:17:09.436948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05064","last_updated":"2025-06-10T10:31:39Z","snapshot_observed_at":"2026-08-11T10:30:50.060885Z","submitted_at":"2025-06-05T14:11:11Z","title":"DemoSpeedup: Accelerating Visuomotor Policies via Entropy-Guided Demonstration Acceleration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05064","snapshot_observed_at":"2026-08-02T12:17:09.439753Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.439753Z"},"links":{"cited_paper":"/paper/2506.05064","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:a20c14c527fd84c6ba8c093b4cbba0de83955d7a2a94d64bbf909e5f685423be","observation_id":"66d96e08-d828-4e6b-a92e-5a3970997b4a","resolution":{"observed_at":"2026-08-02T12:17:09.439753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.00062","last_updated":"2026-05-31T05:20:24Z","snapshot_observed_at":"2026-08-10T17:50:20.348588Z","submitted_at":"2025-11-24T04:25:47Z","title":"SpeedAug: Policy Acceleration via Tempo-Enriched Policy and RL Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.00062","snapshot_observed_at":"2026-08-02T12:17:09.442952Z","title":"Nam and S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.442952Z"},"links":{"cited_paper":"/paper/2512.00062","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:22c785ab78c9cc5340e65739bd447581f7c9ab8161df6ddae8c2af2ffbbec466","observation_id":"2457771b-3812-46e2-b4bc-0ee3ca5a50a3","resolution":{"observed_at":"2026-08-02T12:17:09.442952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07371","last_updated":"2026-04-26T08:11:21Z","snapshot_observed_at":"2026-08-02T04:55:04.725448Z","submitted_at":"2025-12-08T10:08:33Z","title":"ESPADA: Execution Speedup via Semantics Aware Demonstration Data Downsampling for Imitation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07371","snapshot_observed_at":"2026-08-02T12:17:09.446198Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.446198Z"},"links":{"cited_paper":"/paper/2512.07371","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:2dc087065549b86201ec7412dd274c519f69438c1de0b9ea20101caf74f89568","observation_id":"a41eb2ec-ed2e-47ed-9925-21d943e20753","resolution":{"observed_at":"2026-08-02T12:17:09.446198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11948","last_updated":"2025-09-08T02:56:08Z","snapshot_observed_at":"2026-08-09T20:33:11.965065Z","submitted_at":"2025-06-13T16:58:20Z","title":"SAIL: Faster-than-Demonstration Execution of Imitation Learning Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11948","snapshot_observed_at":"2026-08-02T12:17:09.449232Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.449232Z"},"links":{"cited_paper":"/paper/2506.11948","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:a7e31418bae9608cff39677063600697eaa792002ed70ced20055ae134f9f616","observation_id":"f5ec1ac5-3fba-445a-9b60-8a79c252f346","resolution":{"observed_at":"2026-08-02T12:17:09.449232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.452807Z","title":"Ratliff, M","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.452807Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:1d59bb272fe2e13ca694bd3f8a2e8e777ea8e8b7cd90655ec579b805dc4ef4cc","observation_id":"ff9401c2-6006-4d9e-a9e8-080776cfd291","resolution":{"observed_at":"2026-08-02T12:17:09.452807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.02854","last_updated":"2018-07-25T07:54:52Z","snapshot_observed_at":"2026-07-06T06:17:49.353933Z","submitted_at":"2018-01-09T09:44:21Z","title":"Riemannian Motion Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.02854","snapshot_observed_at":"2026-08-02T12:17:09.456029Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.456029Z"},"links":{"cited_paper":"/paper/1801.02854","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:3de664cfa8d34c8d845e04a445923a86ef14e756a5fc14552a1ce6db21ad15cf","observation_id":"24c0e6c2-4ccc-4b1d-b3a0-7c8aef529d8c","resolution":{"observed_at":"2026-08-02T12:17:09.456029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.460018Z","title":"Sundaralingam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.460018Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:3122dcfabfa03dbec5b86907e3bae6785f72d1a4fcc29695bf78d298df2799ce","observation_id":"23747404-0505-4e68-9476-f8628463af7f","resolution":{"observed_at":"2026-08-02T12:17:09.460018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02523","last_updated":"2026-04-02T21:23:08Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T21:23:08Z","title":"Tune to Learn: How Controller Gains Shape Robot Policy Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02523","snapshot_observed_at":"2026-08-02T12:17:09.463790Z","title":"Bronars, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.463790Z"},"links":{"cited_paper":"/paper/2604.02523","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:b894049f11885d3939fd28e76b9f49e401929ba3ee1ecff5ff33fd24e8d62105","observation_id":"268a246b-515a-47ac-93e7-1df28c04ff35","resolution":{"observed_at":"2026-08-02T12:17:09.463790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:17:09.467127Z","title":"Shoemake","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.467127Z"},"links":{"citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:64b47d88b72453fad92b6e297134a9c906a6449a68249d35562b8fbb88e18d68","observation_id":"0e6ac0bb-aaac-4758-8853-160a8159d60c","resolution":{"observed_at":"2026-08-02T12:17:09.467127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-02T12:17:09.470043Z","title":"Beyer, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.470043Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:3739fb79254ddf9e58d7f30e1f0a2c68545e4201c9f2fab2c0ac1c73506ae205","observation_id":"9f91f4ca-24bd-45a4-aeec-55a2bab1e4de","resolution":{"observed_at":"2026-08-02T12:17:09.470043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T12:17:09.473142Z","title":"exterior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.473142Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:066f3ca2272a57836d499d73e869fb88fe3569fa32b562bb0fbe3f7fb4a7019d","observation_id":"c8b02e85-fbd2-4e62-9f4b-21a14befe33b","resolution":{"observed_at":"2026-08-02T12:17:09.473142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 3 inbound Pith citation observations for arXiv:2606.06491."}