{"as_of":"2026-08-08T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9fb4ebce9dc61059be15a94785a9adf60b0457921b4a81f3a35a7f59ac5fc7be","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:43:04.537493Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:36:11.929173Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-06T23:36:11.929173Z","title":"Think twice, act once: Token-aware compression and action reuse for efficient inference in vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17639","last_updated":"2026-06-16T03:02:33Z","snapshot_observed_at":"2026-08-07T21:39:08.232650Z","submitted_at":"2025-06-21T08:45:32Z","title":"RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:36:11.929173Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2506.17639"},"observation_digest":"sha256:897920cc5e3c21da923f55a452719beee2b6f28f479707b9fbfd77fe11105ec9","observation_id":"27e0a52e-db45-4355-a05b-7d132211f3f4","resolution":{"observed_at":"2026-08-06T23:36:11.929173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:a71e9eae0537592b72284c07cb2e189d986eefaa9b6eb79faea56fdbe2bcbb88","observation_id":"e9ad02eb-0de1-4f98-89bb-7bfaae0e40a2","resolution":{"observed_at":"2026-05-17T20:28:16.251395Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-04T09:08:12.680018Z","title":"Think twice, act once: Token-aware compression and action reuse for efficient inference in vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:12.680018Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:199449bfba4056f936ce0c01ca69fbeb143ef86585d3f83820c432491668183e","observation_id":"5cc907b8-c95a-409f-af39-091b8910feed","resolution":{"observed_at":"2026-08-04T09:08:12.680018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2511.18082","last_updated":"2026-04-13T14:33:40Z","snapshot_observed_at":"2026-08-03T08:04:04.746061Z","submitted_at":"2025-11-22T14:44:03Z","title":"ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T06:07:42.311608Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2511.18082"},"observation_digest":"sha256:b9d1bc382eff5f2f79444464723c39a06b78a88c3223c879797a45f3f8b8f6f0","observation_id":"c7669fec-08b0-4352-868d-3ff350b648b3","resolution":{"observed_at":"2026-05-17T06:09:09.433198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-03T09:07:39.309018Z","title":"Think twice, act once: Token-aware compression and action reuse for efficient inference in vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14945","last_updated":"2026-06-24T08:09:11Z","snapshot_observed_at":"2026-08-03T09:07:37.767508Z","submitted_at":"2026-01-21T12:43:11Z","title":"TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T09:07:39.309018Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2601.14945"},"observation_digest":"sha256:05427ddd88e21bdf25eb1123978fcfe53d177b96f0d21d9663556b877c09da05","observation_id":"d75ee6f8-1593-40a5-aff7-9f64f760f4ba","resolution":{"observed_at":"2026-08-03T09:07:39.309018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2603.01581","last_updated":"2026-04-27T12:47:49Z","snapshot_observed_at":"2026-07-06T22:47:33.195274Z","submitted_at":"2026-03-02T08:12:03Z","title":"KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T18:39:58.095112Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2603.01581"},"observation_digest":"sha256:c312cdf050d248b69cbf14cff7699154598992ec2489cdb2025d3345793a86a3","observation_id":"cdeed0c5-557e-4128-8df2-49523da42a74","resolution":{"observed_at":"2026-05-15T18:40:14.434166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2603.14371","last_updated":"2026-05-18T10:25:25Z","snapshot_observed_at":"2026-08-02T15:59:44.938725Z","submitted_at":"2026-03-15T13:23:56Z","title":"OxyGen: Unified KV Cache Management for VLA Inference under Multi-Task Parallelism","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T11:46:12.134869Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2603.14371"},"observation_digest":"sha256:0d55df9010b22d7f6a6b65da89c0d3f34646d9f2ec31ffeb1bd1258be8bea04f","observation_id":"566736a1-5b5a-44d2-9456-127d74258f25","resolution":{"observed_at":"2026-05-21T11:50:03.934133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2604.05323","last_updated":"2026-04-07T01:52:42Z","snapshot_observed_at":"2026-07-06T22:54:04.491386Z","submitted_at":"2026-04-07T01:52:42Z","title":"VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:33:26.708966Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2604.05323"},"observation_digest":"sha256:e292c46e7b06fbdb781e34017ad9e246d6cb24a2f6f8bd93e4008fa6decaa91c","observation_id":"ebda3e5c-1bb5-4920-babb-7c268ddb6849","resolution":{"observed_at":"2026-05-11T00:25:50.142804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2605.11459","last_updated":"2026-05-14T03:19:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T03:17:59Z","title":"Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T02:19:39.604140Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2605.11459"},"observation_digest":"sha256:ff16911fb81d7f754ec086855287740907961e6259a3f884fb778fa969b17975","observation_id":"a65763df-9030-4369-a569-943e7c27f4f5","resolution":{"observed_at":"2026-05-13T02:22:06.687892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2605.11459","last_updated":"2026-05-14T03:19:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T03:17:59Z","title":"Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T06:13:12.442859Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2605.11459"},"observation_digest":"sha256:6d88609c57aea380b1635c6da47f03dcd506ae9f86dd05b526831e8f239121f6","observation_id":"2a3220a9-f94f-44ad-8e8d-4501e7d6aa96","resolution":{"observed_at":"2026-05-15T06:15:07.104557Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2605.13548","last_updated":"2026-06-01T10:46:32Z","snapshot_observed_at":"2026-08-07T20:52:28.800992Z","submitted_at":"2026-05-13T13:55:37Z","title":"AttenA+: Rectifying Action Inequality in Robotic Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T18:43:08.029165Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2605.13548"},"observation_digest":"sha256:30c4f7b4bd5edf6abb836dffed3ffc538e2dcf8acc87c7121791310185e172bf","observation_id":"346d9813-74f7-4774-a93f-75f41c53f5bf","resolution":{"observed_at":"2026-05-14T18:47:37.220705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2605.13548","last_updated":"2026-06-01T10:46:32Z","snapshot_observed_at":"2026-08-07T20:52:28.800992Z","submitted_at":"2026-05-13T13:55:37Z","title":"AttenA+: Rectifying Action Inequality in Robotic Foundation Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T21:42:05.592911Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2605.13548"},"observation_digest":"sha256:a683d110c046fbd2e3dccd198a26ae15296f383bd2973af5d97d8001607c910d","observation_id":"012a3ec7-7c05-4075-a2b5-c77670f3a936","resolution":{"observed_at":"2026-07-01T14:25:45.902573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2605.29438","last_updated":"2026-05-28T06:33:05Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T06:33:05Z","title":"ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T07:16:27.229603Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2605.29438"},"observation_digest":"sha256:e153d572687647c2b7375c09bd853db912b14d23ffc93f92ac4b71c1f1991c1a","observation_id":"207fda53-dc32-48a8-a34f-e553e199d3a8","resolution":{"observed_at":"2026-06-29T07:23:13.041269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2606.03188","last_updated":"2026-06-02T05:48:02Z","snapshot_observed_at":"2026-08-02T21:40:51.638082Z","submitted_at":"2026-06-02T05:48:02Z","title":"GeoSem-WAM: Geometry- and Semantic-Aware World Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T10:11:10.246045Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2606.03188"},"observation_digest":"sha256:f2cddd042d376a9600a07307fc315495b36de22bbb6b5b1890b38ff3eb89c233","observation_id":"43146e1b-4c59-4bc5-a8d3-d2e9ed35e07b","resolution":{"observed_at":"2026-07-02T03:16:34.619734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2606.22794","last_updated":"2026-06-22T03:10:19Z","snapshot_observed_at":"2026-08-04T03:01:53.810285Z","submitted_at":"2026-06-22T03:10:19Z","title":"UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T08:57:01.861091Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2606.22794"},"observation_digest":"sha256:e2788d0e3e2a4f29ff64d0c5142dd552e9d9c70ab0736b5b827409c46449f04c","observation_id":"10a0d5dd-2dfe-427d-b614-7934d9e4435a","resolution":{"observed_at":"2026-07-04T10:19:47.661540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2606.22907","last_updated":"2026-06-22T06:46:26Z","snapshot_observed_at":"2026-08-02T22:43:48.794820Z","submitted_at":"2026-06-22T06:46:26Z","title":"Improving Robotic Imitation Learning via Trajectory Standardization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T08:37:26.864436Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2606.22907"},"observation_digest":"sha256:e033a5fec3141dec72b1e5634f3a8062f1eaad31783b6cc353ecbd3be92d3cb7","observation_id":"8bdac25c-b34c-4d14-943d-f0123da50301","resolution":{"observed_at":"2026-07-04T10:39:45.564349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2606.27755","last_updated":"2026-06-26T06:22:17Z","snapshot_observed_at":"2026-07-07T00:01:54.432346Z","submitted_at":"2026-06-26T06:22:17Z","title":"Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-29T04:56:00.919208Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2606.27755"},"observation_digest":"sha256:82cf3ac6072183989bf16b849c4082b112d49f926fde9e8de04df8632e2932d3","observation_id":"c89b7deb-90ab-4cc3-b7c5-789c8b0edc79","resolution":{"observed_at":"2026-06-29T19:03:52.300386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.21200","doi":"10.48550/arxiv.2505.21200","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21200","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.21200 (2025)","venue":"ArXiv.org","work_id":"3493400f-3b60-4a1c-aa41-91ce092ef587","year":2025},"citing_paper":{"arxiv_id":"2606.31382","last_updated":"2026-06-30T09:10:31Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:10:31Z","title":"Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T05:07:45.792132Z"},"links":{"cited_paper":"/paper/2505.21200","citing_paper":"/paper/2606.31382"},"observation_digest":"sha256:42a34928e7576329735bf31d54b99ce3f84427ecf03d48b894f88b774b61983d","observation_id":"6ee57c48-dd03-412e-ba93-5ae81aa47fbb","resolution":{"observed_at":"2026-07-01T10:45:42.864902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21200/citation-record","integrity":"/paper/2505.21200/integrity","json":"/paper/2505.21200/citation-record.json","paper":"/paper/2505.21200"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T13:42:58.620579Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:58.620579Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:abc6aa1cf84d832cabbe6b0e380ccb6fa433c1d631f80cbdc4cdb5b1ba89f032","observation_id":"42200279-e32f-4538-8d46-af1268e082e5","resolution":{"observed_at":"2026-08-07T13:42:58.620579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:42:58.759097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:58.759097Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:64f8171d3c8b1ee72eae8dcc684dc5a50fbc5d6f458bb849f09f7ee49bf54e17","observation_id":"220d2467-d9a8-4f82-af99-bfdd8cdf092a","resolution":{"observed_at":"2026-08-07T13:42:58.759097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T13:42:58.929949Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:58.929949Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:02313dafdaa1931972d977d53a59c1e1669bec334fe09d41c66acc0221710459","observation_id":"f040c164-af62-4b84-a709-3bca321d088b","resolution":{"observed_at":"2026-08-07T13:42:58.929949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T13:42:59.076821Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:59.076821Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:85991b859d6972d699075636c5a64b1eecf1515b204b6ac74edc0955d228aab1","observation_id":"b33ab496-7c76-4034-bbbe-d09dfbaccd17","resolution":{"observed_at":"2026-08-07T13:42:59.076821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T13:42:59.173764Z","title":"Cheang, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:59.173764Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:ba2aadac867627a2c8830166aac34f6266d5804bd86d6a1d19120046dd087a9f","observation_id":"b38532cb-ba0d-403a-a6c3-4d68fef0db36","resolution":{"observed_at":"2026-08-07T13:42:59.173764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:06.705597Z","title":null,"venue":null,"work_id":"b9d95086-2869-481d-a212-91faa5f0cc12","year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:59.237915Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:0a37562d026408d267d05c3b497f874e6de84b0102356211d8fd2d3698c0bdbc","observation_id":"262519e2-caa4-4cbf-b62e-00dbd37ca820","resolution":{"observed_at":"2026-08-07T13:43:06.768722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:06.565000Z","title":null,"venue":null,"work_id":"16448f16-11cd-4aea-aa53-d63875b36adb","year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:59.492720Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:ff366109ababf27bc25e6221af65261539c9a70cf6cfd8cb2dab5ec9478d48bd","observation_id":"5552c08d-1b32-43ac-aee0-2431f622ec04","resolution":{"observed_at":"2026-08-07T13:43:06.651756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:06.388360Z","title":null,"venue":null,"work_id":"60d5f577-f1eb-4464-9fd3-e2f82b491a93","year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:59.647436Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:b4d53f3d0bf295b153477630449a5c654878a9007ef1359da642a5b582421f46","observation_id":"ef69b40b-65a0-4648-8698-b9ac0637225c","resolution":{"observed_at":"2026-08-07T13:43:06.466170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:06.229806Z","title":null,"venue":null,"work_id":"03f769e0-cb1d-4e4d-9478-db18c0d92f2d","year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:59.712646Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:f6b5517c9215309f75af72b7cd840219e36dbbe0b738f7b15dbd7e8a7b2a5428","observation_id":"2e7eda50-524d-4190-a527-f414ba586b84","resolution":{"observed_at":"2026-08-07T13:43:06.302972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:42:59.879271Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:42:59.879271Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:e76d78b922f750d8392961bb4205611cb4a71828d00c9d23d41d75313dbf44e1","observation_id":"14bfbcab-b152-44de-b9fe-5e4af94d01e5","resolution":{"observed_at":"2026-08-07T13:42:59.879271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:00.008350Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:00.008350Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:6a1bdcd6aef60f22f8b26650fb46d17ca65fc91c6d150566af357afb24b9f33c","observation_id":"af051aea-0e19-4b7f-96ae-f55f54d1c16c","resolution":{"observed_at":"2026-08-07T13:43:00.008350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18915","last_updated":"2024-08-29T16:07:30Z","snapshot_observed_at":"2026-07-06T18:37:43.309281Z","submitted_at":"2024-06-27T06:12:01Z","title":"Manipulate-Anything: Automating Real-World Robots using Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18915","snapshot_observed_at":"2026-08-07T13:43:00.230985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:00.230985Z"},"links":{"cited_paper":"/paper/2406.18915","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:c8680ce14179756a31137b9aa5fe61176961e4525c4ad93c0b184e092283b334","observation_id":"8df6e184-76dd-4822-a79d-9717c2273671","resolution":{"observed_at":"2026-08-07T13:43:00.230985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00595","last_updated":"2023-09-26T10:47:35Z","snapshot_observed_at":"2026-07-06T15:49:23.374270Z","submitted_at":"2023-07-02T15:33:31Z","title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00595","snapshot_observed_at":"2026-08-07T13:43:00.431971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:00.431971Z"},"links":{"cited_paper":"/paper/2307.00595","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:2be3fa72126c83baad5938d73826d72690a21283ad36cd895e02255ff6463d72","observation_id":"e6e1485c-b068-44a3-b2bd-e5fe14d36143","resolution":{"observed_at":"2026-08-07T13:43:00.431971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15959","last_updated":"2025-03-23T05:03:59Z","snapshot_observed_at":"2026-07-06T19:37:03.013065Z","submitted_at":"2024-10-21T12:43:54Z","title":"Diffusion Transformer Policy","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15959","snapshot_observed_at":"2026-08-07T13:43:00.597211Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:00.597211Z"},"links":{"cited_paper":"/paper/2410.15959","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:debc9de4be4acaea8e9b1b5898ffb3c3fdfb116e8900a82956164bb18955e1a8","observation_id":"55fea985-5ab4-45d7-ae53-ef1212805730","resolution":{"observed_at":"2026-08-07T13:43:00.597211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:00.735532Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:00.735532Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:815faa55bb1fcb6c300505f61a570c3eb0ad1dded402ec6e781bcbf10cfb90eb","observation_id":"9e645849-c1fb-48f3-96b6-e46d5bcf4fe1","resolution":{"observed_at":"2026-08-07T13:43:00.735532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:06.023651Z","title":"Jiang, X","venue":null,"work_id":"f1ab4836-4103-473d-83f5-c5ccc37fd2b5","year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:00.879965Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:7bdc1c2433db044dcb2c8e76c5a1cb73e4880d55d33813984eedfa2ed8b720c8","observation_id":"5f2091d7-02ca-4580-a627-db9cc2403b6e","resolution":{"observed_at":"2026-08-07T13:43:06.120893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-07T13:43:01.083162Z","title":"Khazatsky, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:01.083162Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:cd793aad6f9a21060a7296e09c83c7470abacdc42e066aa023fdf486a3045fd6","observation_id":"9d404b8d-14f8-44d9-86af-fd0f71ed1923","resolution":{"observed_at":"2026-08-07T13:43:01.083162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-07T13:43:01.279474Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:01.279474Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:482187dee1f7714a7fcdcabe07533375795e0c24f0ff310b68ffa1caf54b892f","observation_id":"4050d5a9-723a-4ca2-aeaf-cabc24b5d3b5","resolution":{"observed_at":"2026-08-07T13:43:01.279474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T13:43:01.351486Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:01.351486Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:6660588cc90d493c5f390b8db140a5582d98fb4c21485c30e658e46362d3e106","observation_id":"9b4c248c-1307-4904-93bb-016fe5ee8e86","resolution":{"observed_at":"2026-08-07T13:43:01.351486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03312","last_updated":"2025-04-21T09:34:59Z","snapshot_observed_at":"2026-07-06T19:45:44.484683Z","submitted_at":"2024-11-05T18:54:21Z","title":"Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters","version":2},"cited_work":{"arxiv_id":"2411.03312","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.03312","snapshot_observed_at":"2026-08-07T13:43:05.084447Z","title":"Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters","venue":"cs.CV","work_id":"3d1a6a12-35cb-4098-9398-bdc180e2891d","year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:01.359705Z"},"links":{"cited_paper":"/paper/2411.03312","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:ccc8770cb7ed1c4ad88a9a359eb60988be6b3941989c1cdd526599379fa39cec","observation_id":"664d0ca2-60ca-40e3-9239-9fe0ecb9f715","resolution":{"observed_at":"2026-08-07T13:43:05.160857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T13:43:01.480814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:01.480814Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:d2f842f5c86afce2b2b13e0f1a1f3dab8aa87ca0b82f427ecf282a54588eda73","observation_id":"f06cc0f4-5215-4d09-866f-98dd11e095e7","resolution":{"observed_at":"2026-08-07T13:43:01.480814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-07T13:43:01.638742Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:01.638742Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:1e26ef33013dfcf1b2839b28df844ca89cf23ea0c84ae16b86d404e85d9e121c","observation_id":"34ebeda1-0fb0-4921-8ac1-4c0902d3e029","resolution":{"observed_at":"2026-08-07T13:43:01.638742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T13:43:01.760587Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:01.760587Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:7ce8fb90d33783680e9c367a0d23985a945103670205efe2ac84abd1351e6180","observation_id":"a517b294-5f40-42d8-90fe-a0e1c789012c","resolution":{"observed_at":"2026-08-07T13:43:01.760587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:01.916518Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:01.916518Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:efff609563c87646e4b578bd943c3dfa12607b04dd80aa789e8b65ea1ba397a9","observation_id":"83926484-51c0-4457-93df-48ae6ccede47","resolution":{"observed_at":"2026-08-07T13:43:01.916518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-07T13:43:02.033013Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.033013Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:26b7fd46211ffb3346fb6061850bd62d3b44a71ccbd7c47112eb0d5f12fe6204","observation_id":"d0bc70a6-f547-44cb-8a61-00668dc6b4f8","resolution":{"observed_at":"2026-08-07T13:43:02.033013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T13:43:02.178483Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.178483Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:b3c4b5c2aceb5fec6423b6783d8f8e8265672b36bc7160e51739b7827d75ce0c","observation_id":"8e3fbcf7-60c1-4579-bac9-cf9dbd6b82d4","resolution":{"observed_at":"2026-08-07T13:43:02.178483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-08T00:44:00.494972Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-07T13:43:02.340523Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.340523Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:c389f425e3544f5db8ebca07839f986033b3d979653c1372ddd6427887d5bcfb","observation_id":"6ba2346a-6f98-45c9-a41c-80c1c81e0659","resolution":{"observed_at":"2026-08-07T13:43:02.340523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17355","last_updated":"2025-04-25T17:27:10Z","snapshot_observed_at":"2026-08-06T16:07:46.580235Z","submitted_at":"2024-08-30T15:39:34Z","title":"Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17355","snapshot_observed_at":"2026-08-07T13:43:02.506958Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.506958Z"},"links":{"cited_paper":"/paper/2408.17355","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:a679912e8dad2a6abfdfbc74100ba646c90c60dff881a268b9d941416c8a4576","observation_id":"bede8346-9c03-4645-b231-b8d865439650","resolution":{"observed_at":"2026-08-07T13:43:02.506958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-07T13:43:02.629364Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.629364Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:adabf860a809f075a67d5df8af49b3696fc616c89d1ddde5436df901f4465543","observation_id":"7b4e0d74-7f2c-4ab2-8c46-f9f0c3947d2c","resolution":{"observed_at":"2026-08-07T13:43:02.629364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:02.739636Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.739636Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:6d2ba0dc1d76e731e1f9ce6539f4be047998479d4660481a00d437ca14afd77c","observation_id":"47a2d80b-83af-4431-8303-138fafda7b9b","resolution":{"observed_at":"2026-08-07T13:43:02.739636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:02.744927Z","title":"O’Neill, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.744927Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:bad22672e19859acac9df416a03a8e448999f5710b8844ae811f266638d07e73","observation_id":"be8158a6-1d9b-4d35-af86-66d8b09a0150","resolution":{"observed_at":"2026-08-07T13:43:02.744927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01034","last_updated":"2024-12-02T01:33:49Z","snapshot_observed_at":"2026-08-05T18:49:54.781310Z","submitted_at":"2024-12-02T01:33:49Z","title":"Quantization-Aware Imitation-Learning for Resource-Efficient Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01034","snapshot_observed_at":"2026-08-07T13:43:02.750457Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.750457Z"},"links":{"cited_paper":"/paper/2412.01034","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:0ff65a8893494a4822f131ffe0dd6a3649a31557ba64e35773055ca87ca352cd","observation_id":"d8b20428-4c1d-403e-9387-b86e1b507580","resolution":{"observed_at":"2026-08-07T13:43:02.750457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-07T13:43:02.850761Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:02.850761Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:ed84f8a856e2fc826c60f1d546fcb692b1c9aa270ba299456ae9744f3eab2529","observation_id":"bae20548-c5b9-4c76-a6e5-58533845c6b4","resolution":{"observed_at":"2026-08-07T13:43:02.850761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:05.844892Z","title":"Singh, V","venue":null,"work_id":"2cfd7d26-a8e2-4351-bb9e-b4ef9c436bf3","year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:03.002933Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:856c99d82b99b27cfebde3ed064ee1508029c7675a604b2b6dea01a431725157","observation_id":"5cc97333-604b-4e29-9a59-121840267127","resolution":{"observed_at":"2026-08-07T13:43:05.924852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:03.201022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:03.201022Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:bc95d7d380a7a71dee863d514bd7b8c9a830f8535f47edf32bfc0cb6df47c0ca","observation_id":"bc2b18de-deae-4f08-ad3f-df8ae4ddf3ed","resolution":{"observed_at":"2026-08-07T13:43:03.201022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:43:03.323929Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:03.323929Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:a9aaa570e16bb89817cbadc2baac6484989e2e98f5acb5c5cc4615897c877060","observation_id":"849551f8-8e3d-41bb-8fd4-fde8f3c680d5","resolution":{"observed_at":"2026-08-07T13:43:03.323929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T13:43:03.455619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:03.455619Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:22e46ccb96653a698322f7061e7eb869cfa074860dd3fdfca41b00f7d9adb177","observation_id":"d9b01b24-1d17-4365-b681-446034d39b78","resolution":{"observed_at":"2026-08-07T13:43:03.455619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:03.601909Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:03.601909Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:456d18810e24be6768ea317fae3a4f6a37c1091f18a4b9ecfee46e6b46df6063","observation_id":"0fc3c282-6fd8-4637-930c-58cea05178ab","resolution":{"observed_at":"2026-08-07T13:43:03.601909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:03.749499Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:03.749499Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:e3d3676e6d987b26c5e81218f8d10b9251e0b54eabb3da2bb54ce5b36ad81761","observation_id":"d9482747-4466-46a6-ae62-9b5a24e150ee","resolution":{"observed_at":"2026-08-07T13:43:03.749499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04115","last_updated":"2024-03-08T09:56:47Z","snapshot_observed_at":"2026-07-06T17:40:45.750926Z","submitted_at":"2024-03-07T00:09:07Z","title":"DNAct: Diffusion Guided Multi-Task 3D Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04115","snapshot_observed_at":"2026-08-07T13:43:03.817109Z","title":"Yan, Y .-H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:03.817109Z"},"links":{"cited_paper":"/paper/2403.04115","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:6e78e6972757204c1ced0e8543cdd3239880a4537587b1c7b1c83e02e27b8bbd","observation_id":"f8fc4f28-c74a-48c7-881f-8a7e7109521e","resolution":{"observed_at":"2026-08-07T13:43:03.817109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:03.910286Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:03.910286Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:92e34abf056cfc05ba2b059f96a5cb3af81c5557b60b281eeafe40a067111f23","observation_id":"abffa18c-c2c1-47ef-8a27-82f0e2f3eccf","resolution":{"observed_at":"2026-08-07T13:43:03.910286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:05.725167Z","title":null,"venue":null,"work_id":"a9965598-be49-41f2-9703-d48a854143ef","year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:04.018067Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:7ce291b15b6b68a900d4ce557a627bb3ce0e894f5c19f268921b0254b3597467","observation_id":"8c50a432-9f19-4125-981f-ee77a805da2e","resolution":{"observed_at":"2026-08-07T13:43:05.796712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:04.147405Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:04.147405Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:716571f0728a922347c89cc238a5a4e12f55fa9fa8f930c4c7315b4b41450b28","observation_id":"c769917f-87c4-458b-bc29-fa86fccecb79","resolution":{"observed_at":"2026-08-07T13:43:04.147405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T13:43:04.258730Z","title":"Zhang, Q","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:04.258730Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:578d269cac71c30d02bc7db7b19a7471a2646d14beb57acf6c06c577ce2e75ea","observation_id":"4e812d10-ea7d-45f4-80f4-3e28783cfb9e","resolution":{"observed_at":"2026-08-07T13:43:04.258730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:05.550031Z","title":"Zhang, Z","venue":null,"work_id":"2131176c-a0a5-4976-a8c8-3c0125d0b71f","year":2024},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:04.323508Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:1e8aa2ae9aa7a1042e5fb234704b562257ef365dc7d6c1aa25e2e6245143927d","observation_id":"87e0c8c6-c14a-4a5f-9e62-32f80e215ed9","resolution":{"observed_at":"2026-08-07T13:43:05.638348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-07T13:43:04.407246Z","title":"Zhang, C.-K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:04.407246Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:e557033b7ccacc30634b70875e5892b3f9311b36a6248c49c0c8785f7f2984de","observation_id":"549af06b-7b60-4c27-9aa4-e09d009bb627","resolution":{"observed_at":"2026-08-07T13:43:04.407246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:43:05.383590Z","title":"Zitkovich, T","venue":null,"work_id":"b3213f03-9c97-49b9-9da5-f756fa01eb0a","year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:04.537493Z"},"links":{"citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:f6a83b522118f76aff492e3ada81d4285c2ec946254168c05e12d1b3f145b7ec","observation_id":"5de09fb8-0c6e-4ec0-b728-13a0d27c0ed1","resolution":{"observed_at":"2026-08-07T13:43:05.434319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 18 inbound Pith citation observations for arXiv:2505.21200."}