{"as_of":"2026-08-08T05:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c6a900dbf664d05102351c7802de1b07209a67abbcb748f79ead37da4f7ec57","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:42:22.520527Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:47:08.917977Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.353580Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":190,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:7e333abb27519610d2056cb85fbaa878b4122564a995292afe81cfa2938a7419","observation_id":"4316c6d6-fead-4c95-9ae8-ee1f59723499","resolution":{"observed_at":"2026-05-17T20:28:16.171413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-04T19:47:08.917977Z","title":"Siyu Xu, Yunke Wang, Chenghao Xia, Dihao Zhu, Tao Huang, and Chang Xu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09090","last_updated":"2025-09-11T01:52:25Z","snapshot_observed_at":"2026-08-07T08:28:40.679181Z","submitted_at":"2025-09-11T01:52:25Z","title":"SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:47:08.917977Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2509.09090"},"observation_digest":"sha256:07cc0ee18d0bfee2b3ca02525310b26f12191745f59feedf09e06179d07225ee","observation_id":"3b59d997-6657-4795-9fa9-181e2d445d87","resolution":{"observed_at":"2026-08-04T19:47:08.917977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-04T09:08:10.480133Z","title":"Efficientvla: Training-free acceleration and compression for vision-language-action models.arXiv preprint arXiv:2506.10100, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:10.480133Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:0b497f1ac9dc7a6b41cb93319c69c235b15974efa5ced5285668bd8d3a956e13","observation_id":"d008c444-3c0a-4ba0-98e6-d5093b28e79b","resolution":{"observed_at":"2026-08-04T09:08:10.480133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2511.15279","last_updated":"2026-04-03T06:36:12Z","snapshot_observed_at":"2026-07-06T22:36:24.466921Z","submitted_at":"2025-11-19T09:42:08Z","title":"Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T21:03:28.341042Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2511.15279"},"observation_digest":"sha256:04c2ab02fb3601eef6410d35d4257ad006f200f0f5f25a78d013fc13761424c6","observation_id":"e53e1bc3-8d58-4f2b-a346-7bdc45d1b570","resolution":{"observed_at":"2026-05-17T21:05:15.691585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2511.18082","last_updated":"2026-04-13T14:33:40Z","snapshot_observed_at":"2026-08-03T08:04:04.746061Z","submitted_at":"2025-11-22T14:44:03Z","title":"ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T06:07:42.311608Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2511.18082"},"observation_digest":"sha256:7f26f5eceb3a00198478b95432e49987dbf1cbb0af597122708acb046495ea47","observation_id":"4e054053-f9d8-44d1-ac88-d40fce46e3fc","resolution":{"observed_at":"2026-05-17T06:09:09.442219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-03T17:38:20.825770Z","title":"Ef- ficientVLA: Training-free acceleration and compression for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11891","last_updated":"2026-07-02T17:23:13Z","snapshot_observed_at":"2026-08-03T17:38:18.677599Z","submitted_at":"2025-12-09T16:53:44Z","title":"VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:38:20.825770Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2512.11891"},"observation_digest":"sha256:a43d55c1fe7b8856ff581cd07116e50fb44412d2f0bf0cc9103cb35b2b9fc510","observation_id":"0f28b4b9-3a3a-4405-a49b-547632d1ed6d","resolution":{"observed_at":"2026-08-03T17:38:20.825770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2601.12894","last_updated":"2026-05-15T13:46:26Z","snapshot_observed_at":"2026-08-02T15:06:51.761583Z","submitted_at":"2026-01-19T09:50:36Z","title":"Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T16:33:41.439450Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2601.12894"},"observation_digest":"sha256:21088259addb7cf9b96ecd919a886fac165e05443c8abfab97cfcaf1357763c8","observation_id":"981cc3f0-e0b8-4a8a-a7d9-342e1c6d426b","resolution":{"observed_at":"2026-05-21T16:34:16.323095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-03T09:07:40.671144Z","title":"Efficientvla: Training-free acceleration and compression for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14945","last_updated":"2026-06-24T08:09:11Z","snapshot_observed_at":"2026-08-03T09:07:37.767508Z","submitted_at":"2026-01-21T12:43:11Z","title":"TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:07:40.671144Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2601.14945"},"observation_digest":"sha256:a4898ac50afc3ab49ed30c57504cee0475fd4b7b6f38c0dbae66228d323ec8e6","observation_id":"02ab87f7-bc0e-40eb-9e14-48390c2f3690","resolution":{"observed_at":"2026-08-03T09:07:40.671144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2602.20309","last_updated":"2026-04-06T23:32:59Z","snapshot_observed_at":"2026-08-02T13:10:10.837199Z","submitted_at":"2026-02-23T19:55:54Z","title":"QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T20:20:10.435886Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2602.20309"},"observation_digest":"sha256:c7194c5f8dfa9fa13dfbc5c789a82211606ce9a5f56de6e710758faad72f8570","observation_id":"6c7d9eef-d914-4cd6-a27e-074b5a3e79db","resolution":{"observed_at":"2026-05-15T20:20:17.316243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2603.01581","last_updated":"2026-04-27T12:47:49Z","snapshot_observed_at":"2026-07-06T22:47:33.195274Z","submitted_at":"2026-03-02T08:12:03Z","title":"KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T18:39:58.095112Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2603.01581"},"observation_digest":"sha256:7d35d7fb2ffff9242093c72873e5fd6f332e8ef2d9ab7695d3d86af6d5aee4ad","observation_id":"f0f7db96-b64f-48a4-b027-42b339bfb857","resolution":{"observed_at":"2026-05-15T18:40:14.556429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2603.14371","last_updated":"2026-05-18T10:25:25Z","snapshot_observed_at":"2026-08-02T15:59:44.938725Z","submitted_at":"2026-03-15T13:23:56Z","title":"OxyGen: Unified KV Cache Management for VLA Inference under Multi-Task Parallelism","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T11:46:12.134869Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2603.14371"},"observation_digest":"sha256:c98ad38b1d23a2acb6d4071d411791c42fb131640a7446fc5ea1be18424091d0","observation_id":"1f69e69a-47b0-4c55-bd0c-c444b8940e1a","resolution":{"observed_at":"2026-05-21T11:50:03.894952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2603.17573","last_updated":"2026-04-27T12:41:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-18T10:25:08Z","title":"HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:50.963123Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2603.17573"},"observation_digest":"sha256:518d5a28b38d1db2f8b982f3231415ce0596920b8d41f22558ee120d02931df7","observation_id":"f7d4b8bd-f3a8-446c-b38e-06586f789013","resolution":{"observed_at":"2026-05-15T09:19:54.367062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2603.25661","last_updated":"2026-04-07T08:13:17Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T17:14:57Z","title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T00:27:35.706107Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2603.25661"},"observation_digest":"sha256:13af6e1bb687e2b30bccc35f1752ac296e61264e85e1b5917663e3d48d602174","observation_id":"64185bdc-e3af-438c-9c05-343412c1578a","resolution":{"observed_at":"2026-05-15T00:28:23.079901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2604.02965","last_updated":"2026-04-03T10:55:51Z","snapshot_observed_at":"2026-08-03T01:48:29.110837Z","submitted_at":"2026-04-03T10:55:51Z","title":"Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T19:45:17.852646Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2604.02965"},"observation_digest":"sha256:13dd51c7e16e55847632b9a44b02615361371592cb4946933a6e92487bbfe527","observation_id":"4d22d0a3-9b6d-46ae-996a-8e5284e889b1","resolution":{"observed_at":"2026-05-13T19:48:11.466762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2604.05656","last_updated":"2026-04-07T09:56:03Z","snapshot_observed_at":"2026-08-03T09:33:28.285405Z","submitted_at":"2026-04-07T09:56:03Z","title":"SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T19:49:43.492952Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2604.05656"},"observation_digest":"sha256:e8f2ef6f845cb9673545c1943a1659c1efd8623b3e9a4a62124e43a642c136ac","observation_id":"c8506f8c-8a63-4f16-b377-97d022dfb03a","resolution":{"observed_at":"2026-05-10T22:30:49.378979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:d2c945fae2de456d88ed0e23506f76aa5beda8c5905d47c49df80a2d9fde7eeb","observation_id":"e1dd9d99-fa7f-46ff-8421-80aa2b4d6211","resolution":{"observed_at":"2026-05-10T22:50:51.343242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2604.24447","last_updated":"2026-04-27T13:12:16Z","snapshot_observed_at":"2026-08-02T20:38:02.984524Z","submitted_at":"2026-04-27T13:12:16Z","title":"Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T03:04:46.460069Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2604.24447"},"observation_digest":"sha256:7ad2716dff25661424a70e26ddd64f25c6ca490e3b613cdfae61525f02408054","observation_id":"95c54592-f7f1-4fec-a8ff-1bd60566a19a","resolution":{"observed_at":"2026-05-11T22:16:52.096217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2605.13316","last_updated":"2026-05-13T10:28:50Z","snapshot_observed_at":"2026-08-01T08:58:50.056321Z","submitted_at":"2026-05-13T10:28:50Z","title":"Test-time Sparsity for Extreme Fast Action Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T19:46:12.266227Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.13316"},"observation_digest":"sha256:b5bfb3a6949efee2b5a645bf7edb3dbb12a0fcc8a736053160b6eb1975d58b69","observation_id":"13ae0dad-5a0d-425c-951a-b9c3994a7148","resolution":{"observed_at":"2026-05-14T19:47:52.891164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2605.13778","last_updated":"2026-05-13T16:57:51Z","snapshot_observed_at":"2026-08-06T15:26:41.871512Z","submitted_at":"2026-05-13T16:57:51Z","title":"Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T17:50:54.574805Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.13778"},"observation_digest":"sha256:5315b6a3eac397486d8f5e4a9437b5cd43e714b79794c3f3b34b5d8bdf7002fe","observation_id":"0107d8df-f2db-41c4-bcb2-7dad63fca88d","resolution":{"observed_at":"2026-05-14T17:52:33.095937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2605.29438","last_updated":"2026-05-28T06:33:05Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T06:33:05Z","title":"ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T07:16:27.229603Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.29438"},"observation_digest":"sha256:fc3c53d32b5dcfe4ca6e6a10cde783b6097e2987063de438c988d9ba6b33fad2","observation_id":"fc81d8d9-83d4-478c-a640-037e81e0d0fe","resolution":{"observed_at":"2026-06-29T07:23:13.012215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T08:40:10.152344Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:1e2e79dcc911a684a04fdfbdc7549dd9099df3c65ba021fba4b2d307712931fd","observation_id":"004af9c3-53d0-4396-bf1c-47914ef8f9b4","resolution":{"observed_at":"2026-06-29T08:43:14.995266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-02T12:54:43.001891Z","title":"arXiv preprint arXiv:2506.10100 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T12:54:43.001891Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:e947b817348c657b05882199761615431688f90c5cfc0573f59c077d26c23177","observation_id":"f04faa39-63e9-4b65-a1d5-0c12d5bd2aba","resolution":{"observed_at":"2026-08-02T12:54:43.001891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.02775","last_updated":"2026-06-01T18:38:21Z","snapshot_observed_at":"2026-08-07T06:38:00.863324Z","submitted_at":"2026-06-01T18:38:21Z","title":"AURA: Action-Gated Memory for Robot Policies at Constant VRAM","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T14:30:49.006075Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.02775"},"observation_digest":"sha256:d1f65ab6fc5d4f756d20cef5e8727525d4d16ab28a6c813e68b818d3242a9c0f","observation_id":"fde631ff-4b09-400d-8c0e-4c4d2d0e9b4c","resolution":{"observed_at":"2026-07-01T23:16:24.312584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T01:14:14.972805Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:df19a62b30c3baa663006ab98b3d37cb2bfbdebcffd2d6c726e7004dfcb894cb","observation_id":"5c1302be-7ab3-445d-b8c5-f0d11d7a5e8e","resolution":{"observed_at":"2026-07-02T13:36:58.831557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-08-02T12:17:09.296034Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06491","last_updated":"2026-07-19T18:14:26Z","snapshot_observed_at":"2026-08-02T12:17:07.877886Z","submitted_at":"2026-06-04T17:59:40Z","title":"TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:09.296034Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.06491"},"observation_digest":"sha256:7798716c1c8f0f774b8ded6bd33efd0b49a738494d0b9ef9e9c684705fe6f7bd","observation_id":"99897dc2-d26b-4804-b5bb-6887768d813a","resolution":{"observed_at":"2026-08-02T12:17:09.296034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.19565","last_updated":"2026-06-17T20:08:14Z","snapshot_observed_at":"2026-08-07T10:17:45.129429Z","submitted_at":"2026-06-17T20:08:14Z","title":"Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T20:57:33.909350Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.19565"},"observation_digest":"sha256:19ca3bcadf5fd113faa5181aa0c4bd888b6923eaf50af5b2d216bbff77fee405","observation_id":"89634f0a-bbe8-42a2-ad79-111bab56487d","resolution":{"observed_at":"2026-07-04T00:49:18.553137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.22540","last_updated":"2026-06-25T01:18:44Z","snapshot_observed_at":"2026-07-06T23:57:23.574340Z","submitted_at":"2026-06-21T14:54:07Z","title":"PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T10:27:00.283283Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.22540"},"observation_digest":"sha256:e2735060ddd42f4865248736c1a10352f789a4c8dd2acbf686c3111471b88798","observation_id":"f05d4f4e-6f77-4a43-b8c6-73abe9bda677","resolution":{"observed_at":"2026-07-04T09:09:43.355026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.30378","last_updated":"2026-06-29T14:38:20Z","snapshot_observed_at":"2026-07-07T00:04:15.048683Z","submitted_at":"2026-06-29T14:38:20Z","title":"OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T06:11:09.693576Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.30378"},"observation_digest":"sha256:374e230bc9cf570c81fe2f96bf81707ecc6893b53ad313ae257a958523e81f79","observation_id":"65af8c99-1171-4d82-b1c8-00e7e2dbdfa6","resolution":{"observed_at":"2026-06-30T06:14:19.071969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10100","snapshot_observed_at":"2026-07-04T09:09:43.353580Z","title":"Efficientvla: Training-free acceleration and compression for vision-language- action models.arXiv preprint arXiv:2506.10100","venue":null,"work_id":"b0efd297-44e1-4480-b40d-3a6de8c42719","year":2025},"citing_paper":{"arxiv_id":"2606.31382","last_updated":"2026-06-30T09:10:31Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:10:31Z","title":"Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-01T05:07:45.792132Z"},"links":{"cited_paper":"/paper/2506.10100","citing_paper":"/paper/2606.31382"},"observation_digest":"sha256:30f7e0fe8792537d06a74a70e9fec951cb62a3a29640fe02fe88aeac08b45344","observation_id":"4a86d6ca-a55f-43b0-9b94-063ce82f6fb4","resolution":{"observed_at":"2026-07-01T10:45:42.872784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10100/citation-record","integrity":"/paper/2506.10100/integrity","json":"/paper/2506.10100/citation-record.json","paper":"/paper/2506.10100"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.372908Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation,","venue":null,"work_id":"b4bd2ef6-9f4c-4115-80fa-fd510eb888d7","year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.343098Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:6972b11eedfcf4d6c1a4d9e1faec6092d332178ebff86f64d2752386fdb7b484","observation_id":"aacf24e7-c2b3-470e-ade4-fb84ea8df2a2","resolution":{"observed_at":"2026-08-07T04:42:23.377905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.348179Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.348179Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:e6e36de4bf28b4d157c78836c6b7f489a43fdd2a558c3c52e532fbcc97370a5f","observation_id":"77609ff6-b538-45c0-b690-64a2a12ff3e2","resolution":{"observed_at":"2026-08-07T04:42:22.348179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.353075Z","title":"Mc-llava: Multi-concept personalized vision-language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.353075Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:4bb88b3e60a4fbf9518a71d76ccfe0a483583cbdc31585f2663406214908cb98","observation_id":"baa521e3-ebf3-4db0-95e3-b65cb896c169","resolution":{"observed_at":"2026-08-07T04:42:22.353075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.347014Z","title":"Llm as dataset analyst: Subpopulation structure discovery with large language model,","venue":null,"work_id":"2b0ef2f5-7c92-457c-9f86-6d3ca55d974b","year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.357974Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:806301d2d27930b11e897c276fe92a3859b09f74c6f51cd5b0cf5c63f884c01f","observation_id":"b27a4e92-8246-41e1-98e8-9775f55dbf25","resolution":{"observed_at":"2026-08-07T04:42:23.352330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T04:42:22.362474Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.362474Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:e0a498c925facc1906b45fdee3d59850067c010b8af2b5c68e4d5a821bf03171","observation_id":"320a45c5-9b07-462e-a697-8adb27f8ccf5","resolution":{"observed_at":"2026-08-07T04:42:22.362474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.330101Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation,","venue":null,"work_id":"c01c55ce-bb2f-4fa3-9f77-f7f939a0fff3","year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.368007Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:2e3d821d4c31bf21c49fe5a0f4ccd602743cb6585e4d3790736a6ac5d39e1ce9","observation_id":"051eb1d3-decf-41ee-a5c5-6e40c862a084","resolution":{"observed_at":"2026-08-07T04:42:23.335146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T04:42:22.372709Z","title":"π0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.372709Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:35dd6c8fc9417a1a65d52e12d41d4684c3b542055d46820a0a4d926efb1c5dbd","observation_id":"1642af91-ea4d-44a1-98b9-a3e6e2d3176e","resolution":{"observed_at":"2026-08-07T04:42:22.372709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T04:42:22.377361Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.377361Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:42ff2ca028e09148df50ad3075e81ea966b85c56299923e2788f19dc04db9d7e","observation_id":"e5399721-7228-49e8-98cb-c05020f66953","resolution":{"observed_at":"2026-08-07T04:42:22.377361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.382025Z","title":"Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.382025Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:02b139c91b869ae3175419b0e0fe3a8e34b09f55cfcb92a4288347c9fb0e9428","observation_id":"85652d90-aaef-4c8e-8508-e489b2b0d284","resolution":{"observed_at":"2026-08-07T04:42:22.382025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.304042Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0,","venue":null,"work_id":"50b59326-5de5-410e-9cc3-7c31f157b2ca","year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.386914Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:e3629bd846d4f8511729262f0c46a42b11ab0074636ba67735eee84c55d0c2fd","observation_id":"020d6a78-a086-4183-beb3-add3f89f3dd3","resolution":{"observed_at":"2026-08-07T04:42:23.309286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T04:42:22.391752Z","title":"Diffusion-vla: Scal- ing robot foundation models via unified diffusion and autoregression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.391752Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:1ed85d08590ee81be816ffb0ae487d82afa9640f91c514b6343f66198092e208","observation_id":"086f3048-ec0e-44a0-a2fb-13ec3e1bccb0","resolution":{"observed_at":"2026-08-07T04:42:22.391752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-07T04:42:22.396376Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.396376Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:9435fa173ed8d2124d55314945822e5de24f0c36d23f3003cda90f650ebcb503","observation_id":"e8d590b4-e47e-4904-b7cc-28c8771c99df","resolution":{"observed_at":"2026-08-07T04:42:22.396376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-07T04:42:22.401474Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.401474Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:90e5c02013e02a289e127018690774f1eaf7be0b229cf99e6590bc6ac08ca870","observation_id":"96c28ed2-9e4b-42b7-84c6-4cdcd2ef2e7a","resolution":{"observed_at":"2026-08-07T04:42:22.401474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T04:42:22.406153Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.406153Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:85fbb125cb0467e86a0c8a76d0bf6f3bc89c2ade550b582ae6d66b9769d017db","observation_id":"c984ae9d-181d-45d3-9eb2-a77891aed692","resolution":{"observed_at":"2026-08-07T04:42:22.406153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.287925Z","title":"Gpt-3: Its nature, scope, limits, and consequences,","venue":null,"work_id":"7c9ef8ed-8734-4316-9f89-e78bd38ac391","year":2020},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.410901Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:0b47c613f99578a3aded743400cbef0997e61c88389f23b8e7786f7af95f683d","observation_id":"ed77cdd5-8a2b-4bb8-bf1b-af55189203de","resolution":{"observed_at":"2026-08-07T04:42:23.293032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:42:22.415264Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.415264Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:f88f4a1737c35795ff6eab62d94e912be02f7794aa274b8acf2d9a12f3b6f132","observation_id":"bc1fd14e-3e80-43ca-9f45-0ef5bf29cc74","resolution":{"observed_at":"2026-08-07T04:42:22.415264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T04:42:22.419997Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.419997Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:7a8182da8d149d1342d017ba44ab9e940ca618e8ffc2d8f78e3c7439bb7a4845","observation_id":"faddad0e-b75c-407b-8653-185e68ed752f","resolution":{"observed_at":"2026-08-07T04:42:22.419997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12212","last_updated":"2025-06-01T05:57:00Z","snapshot_observed_at":"2026-08-07T15:43:46.091658Z","submitted_at":"2025-05-18T03:10:00Z","title":"Data Whisperer: Efficient Data Selection for Task-Specific LLM Fine-Tuning via Few-Shot In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12212","snapshot_observed_at":"2026-08-07T04:42:22.425017Z","title":"Data whisperer: Efficient data selection for task-specific llm fine-tuning via few-shot in-context learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.425017Z"},"links":{"cited_paper":"/paper/2505.12212","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:a6e51f68103b95d297c83c3d5e3e41501f6999eefdcf8cdca9e4f763e563b9cf","observation_id":"743d6ac6-6307-475b-b850-00e59b1f09ba","resolution":{"observed_at":"2026-08-07T04:42:22.425017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.270726Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution,","venue":null,"work_id":"07b48047-a40d-47bf-bd4a-c19b1d0165d8","year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.429692Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:fc4f3ab92e1472293cde417a2195b6ae7c62af4b23a11adb32bdef9df5cdda61","observation_id":"a5275882-d35e-4cee-a032-515921a93d7a","resolution":{"observed_at":"2026-08-07T04:42:23.276043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20384","last_updated":"2025-04-14T11:39:39Z","snapshot_observed_at":"2026-08-07T16:36:01.318021Z","submitted_at":"2025-03-26T10:05:38Z","title":"MoLe-VLA: Dynamic Layer-skipping Vision Language Action Model via Mixture-of-Layers for Efficient Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20384","snapshot_observed_at":"2026-08-07T04:42:22.434287Z","title":"Mole- vla: Dynamic layer-skipping vision language action model via mixture-of-layers for efficient robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.434287Z"},"links":{"cited_paper":"/paper/2503.20384","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:391d90cdaad59659e0d5aa8e832cbca23de026ab3f1ff914443b0ad320eaa8f6","observation_id":"25aa3d8d-ae22-4f6a-993b-bf3401d4953a","resolution":{"observed_at":"2026-08-07T04:42:22.434287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.439171Z","title":"Vla-cache: Towards efficient vision-language-action model via adaptive token caching in robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.439171Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:63e7afa36dc3768657eecd6c4efd5d736807306c678c65d391120ece3fd881f8","observation_id":"959ff49e-de6f-4ee2-8209-1f45cb3ead09","resolution":{"observed_at":"2026-08-07T04:42:22.439171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-07T04:42:22.443858Z","title":"Evaluating real-world robot manipulation policies in simulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.443858Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:fa9cca86a4129e3ba6733cdfdefad32415e030217bb3109da2f5d490f5daeed7","observation_id":"3f6c98d6-7739-49b8-b544-cf5795d88626","resolution":{"observed_at":"2026-08-07T04:42:22.443858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T04:42:22.448483Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.448483Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:76a6507350ec350629ed0aef4a48cbb5d8ff5b2e826c79e113bd8ecb2de049d2","observation_id":"b6f21b8b-0c64-4036-950b-5921283d297f","resolution":{"observed_at":"2026-08-07T04:42:22.448483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.253842Z","title":"Rt- 2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"9d5422a8-385e-4a30-8a0d-d560814c6c06","year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.453348Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:f98dd7c45ccc7faaba0000465e4e9d641393b20207e5bc5ae10d894d43625b7f","observation_id":"3cb5ba0e-88ac-4173-8124-fd95c4ff5bec","resolution":{"observed_at":"2026-08-07T04:42:23.259009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T04:42:22.457907Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.457907Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:3de92db134ae672d80d3956fe9203fa687c72f9a18b5086f2240eea73eacc8ba","observation_id":"086ef63c-0e52-4f4d-a69f-f2d391546eae","resolution":{"observed_at":"2026-08-07T04:42:22.457907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-05T12:05:09.343843Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-08-07T04:42:22.462536Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.462536Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:95981eb7e24ceee8e98a6d9d55e8d14f41db321f56bcb3174aa9bd5a21533263","observation_id":"1c694594-dc43-4882-85ad-42c7e2dc1fc3","resolution":{"observed_at":"2026-08-07T04:42:22.462536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-02T08:01:43.194717Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T04:42:22.467423Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.467423Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:97c4b83aa112d167e7266d029819244f71d3915de08296fcaabe41cc79c16b64","observation_id":"ea5a9fc6-5d0c-4dcb-8641-bf866810c160","resolution":{"observed_at":"2026-08-07T04:42:22.467423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T04:42:22.472319Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.472319Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:f15f83c37ee9a5b66c24ccf005719c53f3b9edff8f21e29bff1f8cf86d13532e","observation_id":"4a52e617-b8ff-47fe-a799-2661b3047795","resolution":{"observed_at":"2026-08-07T04:42:22.472319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T04:42:22.477013Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.477013Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:331ef3a63f365d749d9af8928b9b8b9655c8c9a8e00b53b286f8b5238ed78261","observation_id":"3c1a0722-21f1-41da-acc7-e306163ea6bf","resolution":{"observed_at":"2026-08-07T04:42:22.477013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.481621Z","title":"Shifting ai efficiency from model-centric to data-centric compression,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.481621Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:b0f2cc38ce888e9fb4540389c2b9dbda476f680f7f085f3ab5b21d81738bbe1a","observation_id":"4c7fdd45-9494-44f5-adf2-6742c56bd912","resolution":{"observed_at":"2026-08-07T04:42:22.481621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11494","last_updated":"2025-06-08T08:35:58Z","snapshot_observed_at":"2026-08-08T00:45:20.646947Z","submitted_at":"2025-02-17T06:56:28Z","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11494","snapshot_observed_at":"2026-08-07T04:42:22.486234Z","title":"Stop looking for important tokens in multimodal language models: Duplication matters more,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.486234Z"},"links":{"cited_paper":"/paper/2502.11494","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:5f182be5f029c19b08203c3a372ece46da73bc46d989d703b78e6cd4cf555926","observation_id":"cacd0bc7-fd66-4a1a-9f80-daaf0b49ed6a","resolution":{"observed_at":"2026-08-07T04:42:22.486234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-07T04:42:22.491193Z","title":"Robomamba: Efficient vision-language-action model for robotic reasoning and manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.491193Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:b51d4a56e6f34e1ed9de5b59b6d4c3d13ede177359d5f05cf5fd7c131b455573","observation_id":"4028d45d-1f3b-4f46-8544-e66684b8a3ec","resolution":{"observed_at":"2026-08-07T04:42:22.491193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07795","last_updated":"2022-10-14T13:26:41Z","snapshot_observed_at":"2026-08-03T13:04:29.259108Z","submitted_at":"2022-10-14T13:26:41Z","title":"EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07795","snapshot_observed_at":"2026-08-07T04:42:22.496390Z","title":"Efficientvlm: Fast and accurate vision-language models via knowledge distillation and modal-adaptive pruning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.496390Z"},"links":{"cited_paper":"/paper/2210.07795","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:9363e9add0df827790cbb6e42e5ee58b5fc30a4c08bad6a9b4f1e4e6dfa16516","observation_id":"78a1091e-b3b4-4e90-b66a-76d73d61b983","resolution":{"observed_at":"2026-08-07T04:42:22.496390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T04:42:22.501557Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.501557Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:d30fef6090f6b4da8ab1e2cdddee8f2a064904953189227e2c5ee56aeaea8af3","observation_id":"e0915ada-6900-45e5-b8dd-2469232b64b2","resolution":{"observed_at":"2026-08-07T04:42:22.501557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:22.506407Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.506407Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:a2c0e82b28168f526253be6a8173796ad719a3a423b9db5b50a42d11d194a3cf","observation_id":"f11bb0b0-6789-4eb2-8ab4-4115c366cbee","resolution":{"observed_at":"2026-08-07T04:42:22.506407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T04:42:22.511092Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.511092Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:921c355456d2e847ead39045c02c87016a34ac8dda45bcc6df1263ba7375df37","observation_id":"5c166334-8866-4bf3-9b26-33e05a25f187","resolution":{"observed_at":"2026-08-07T04:42:22.511092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:23.224772Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models,","venue":null,"work_id":"5f4d558d-fb85-4969-85da-9cd405482b4c","year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.515825Z"},"links":{"citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:4e7b0f76fe0347f2b671d6cb69fd6b3794d4edd9fb44cac415e1fba0dd84961d","observation_id":"b1069ea2-5275-431a-955b-85ad8ec40f76","resolution":{"observed_at":"2026-08-07T04:42:23.231985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15296","last_updated":"2025-02-28T15:23:40Z","snapshot_observed_at":"2026-07-06T20:26:07.715114Z","submitted_at":"2025-01-25T18:26:39Z","title":"You Only Prune Once: Designing Calibration-Free Model Compression With Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15296","snapshot_observed_at":"2026-08-07T04:42:22.520527Z","title":"You only prune once: Designing calibration-free model compression with policy learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.520527Z"},"links":{"cited_paper":"/paper/2501.15296","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:edd8c4c5770a1d130627a7bd8165767bfbd386c65e37aae45cc83d0598a778de","observation_id":"052e0a74-8ea6-4abe-9850-bfc6f7250a8c","resolution":{"observed_at":"2026-08-07T04:42:22.520527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:45:54.471297Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 29 inbound Pith citation observations for arXiv:2506.10100."}