{"as_of":"2026-08-06T12:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5879f4366c5ac6ef778d28e3b5f9e42da604fd1540d91cee8ec6196df292c7f5","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:14:02.361658Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T12:54:41.821598Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T13:59:52.612293Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-02T13:37:33.218495Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:13.188363Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:f2b8fc04084a30498caf9be2391882e64e5b30960f2b257841d5b72c630c2ea9","observation_id":"c028bb8a-eca3-4120-95a3-508c257b5e13","resolution":{"observed_at":"2026-05-26T03:04:58.134498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-02T13:37:33.218495Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T10:48:56.280105Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:dda95f47215c77cfea5c8f32ec0fa6c8aa7c4f78ad96685080886ad5e1426d71","observation_id":"9472c73b-7ba7-4a65-81ed-78210ecd7561","resolution":{"observed_at":"2026-05-26T03:04:58.134498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2605.02739","last_updated":"2026-05-04T15:37:55Z","snapshot_observed_at":"2026-08-02T08:53:23.942372Z","submitted_at":"2026-05-04T15:37:55Z","title":"Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T17:49:40.820795Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2605.02739"},"observation_digest":"sha256:6ca49c3e1c8ae1f00400f67f84b7a3394b5eb6e3eb35ba1acbf948b05fc7bf29","observation_id":"07e8a87a-679e-4656-b5d9-029ff9a003a0","resolution":{"observed_at":"2026-05-26T03:04:58.134498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2605.12160","last_updated":"2026-05-12T14:10:54Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:10:54Z","title":"Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T04:55:23.145492Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2605.12160"},"observation_digest":"sha256:073271f3a96688f73da35a719201e0b6facca0a3a4d413fbc252737067ead864","observation_id":"3f177c87-3da0-455d-80d7-2737b7ff620e","resolution":{"observed_at":"2026-05-26T03:04:58.134498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2605.29438","last_updated":"2026-05-28T06:33:05Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T06:33:05Z","title":"ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T07:16:27.229603Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2605.29438"},"observation_digest":"sha256:1d448ab0a80a61b7f9c6adacb13da8081a572e429fe4922cd82e74895caec803","observation_id":"1721c3c9-0fbf-49dc-ad41-b40bcaae07ce","resolution":{"observed_at":"2026-06-29T07:23:13.033777Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T08:40:10.152344Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:ff97b98a9f618b4829312099c61bc48b943568d28f7ae292bcf37c2f71016a61","observation_id":"3344ac15-497f-49f1-9f8a-754a284f91f7","resolution":{"observed_at":"2026-06-29T08:43:14.929449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-08-02T12:54:41.821598Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.29662","last_updated":"2026-07-24T01:54:48Z","snapshot_observed_at":"2026-08-02T12:54:38.753199Z","submitted_at":"2026-05-28T09:23:08Z","title":"SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T12:54:41.821598Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2605.29662"},"observation_digest":"sha256:fae91b9b24c392f3ddcb5d6a66c89e7862045a3cf177761b1ca9cce57d9efde1","observation_id":"f383a69e-fd5d-4d48-b8f8-811ebf58efa6","resolution":{"observed_at":"2026-08-02T12:54:41.821598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2606.03503","last_updated":"2026-06-02T11:21:27Z","snapshot_observed_at":"2026-08-02T04:20:08.895288Z","submitted_at":"2026-06-02T11:21:27Z","title":"ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T10:07:16.700499Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2606.03503"},"observation_digest":"sha256:816d127ad16d80e2f514b55c004bee3d4fe9db41f3bd3db21069dd2868de3359","observation_id":"fd6a2328-aa74-4ade-942f-ff01d09b57fc","resolution":{"observed_at":"2026-07-02T03:26:28.729967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2606.27295","last_updated":"2026-06-26T13:05:58Z","snapshot_observed_at":"2026-07-07T00:01:29.987067Z","submitted_at":"2026-06-25T17:13:02Z","title":"LA4VLA: Learning to Act without Seeing via Language-Action Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T04:41:13.473022Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2606.27295"},"observation_digest":"sha256:5b655f516c450ead13c86557b4514edd7d747e157f0002d03995ba87a625e5f2","observation_id":"55ed6354-5505-41e3-bd37-7a7b4a353d67","resolution":{"observed_at":"2026-07-04T13:59:52.613556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"cited_work":{"arxiv_id":"2511.16449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16449","snapshot_observed_at":"2026-07-04T13:59:52.612293Z","title":"arXiv preprint arXiv:2511.16449 (2025)","venue":"cs.CV","work_id":"93f7fc16-f76f-4afc-b105-f482a70c6e2a","year":2025},"citing_paper":{"arxiv_id":"2606.27295","last_updated":"2026-06-26T13:05:58Z","snapshot_observed_at":"2026-07-07T00:01:29.987067Z","submitted_at":"2026-06-25T17:13:02Z","title":"LA4VLA: Learning to Act without Seeing via Language-Action Pretraining","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T04:38:02.797595Z"},"links":{"cited_paper":"/paper/2511.16449","citing_paper":"/paper/2606.27295"},"observation_digest":"sha256:3b08b4c2e907952074b177c0a8abb02ef2c27ee66395e4e74f5897feaaf8be0e","observation_id":"1b9c9e52-e297-4207-a682-8bbf99d7c9a6","resolution":{"observed_at":"2026-06-29T19:53:56.093245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.16449/citation-record","integrity":"/paper/2511.16449/integrity","json":"/paper/2511.16449/citation-record.json","paper":"/paper/2511.16449"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:52.982102Z","title":"Nocaps: Novel object caption- ing at scale","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:52.982102Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:d70cc1568d56933c2b0dd81ec76a0fee071e2fc8fbc5aa18f2ea566c6274f0fe","observation_id":"523ef674-186c-47a5-b79f-70f216764b6a","resolution":{"observed_at":"2026-08-03T21:13:52.982102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:53.102464Z","title":"Divprune: Diversity-based visual token pruning for large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:53.102464Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:b8387c59971205b157368252f58133f790e13355c6a145ac22a551bb4043bc72","observation_id":"027dda6f-241f-4936-9e07-ade1bf149914","resolution":{"observed_at":"2026-08-03T21:13:53.102464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-03T21:13:53.258938Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 1(2):3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:53.258938Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:4c8c2252650fd66268d8c785a1c2040410564475108de1b55ef669e5e48bd5d2","observation_id":"dde09cef-a399-4f1f-bb1b-f11e9daa696f","resolution":{"observed_at":"2026-08-03T21:13:53.258938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-03T21:13:53.434223Z","title":"1, 2, 3, 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:53.434223Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:5a38f7da532da481f9aec49cf60fca0f1391d766076679e63226fd96374c5503","observation_id":"79561e4a-9bf3-4d99-b6cf-8e9212efde30","resolution":{"observed_at":"2026-08-03T21:13:53.434223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:53.606657Z","title":"John Wiley & Sons, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:53.606657Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:b0ec4dd152d8e2c01c472b970e94077d7e826eb60637d966c013ac5955d6f408","observation_id":"3b967f54-e9e7-43ac-9e0b-0ca2ca51df74","resolution":{"observed_at":"2026-08-03T21:13:53.606657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:53.806956Z","title":"Springer, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:53.806956Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:140f073f6a8956b34cc63ea8cfbefe9fae4df3dbf584fecdd370b79c27024211","observation_id":"d96e85f8-3860-4a2e-a730-164231228012","resolution":{"observed_at":"2026-08-03T21:13:53.806956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-03T21:13:54.012965Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:54.012965Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:9233843e44d7df9ee3e1e45c33ae86e68ed0150400fdd2e710656dee2ca43ccf","observation_id":"a06a6e62-6481-4964-b103-7cdf6b851750","resolution":{"observed_at":"2026-08-03T21:13:54.012965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:54.233243Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:54.233243Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:3c4048a4301d4e045b018adee036bd2e47b50ce642c4646add385243ffe571a8","observation_id":"d00ed54c-f655-4514-8d08-15582eceae21","resolution":{"observed_at":"2026-08-03T21:13:54.233243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:54.447436Z","title":"Diffusion policy: Visuomotor policy learning via action dif- fusion.The International Journal of Robotics Research, 44 (10-11):1684–1704, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:54.447436Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:a6e6babe9c7ef1e7ad0ba1b0027f1d310b8677feabcbf96b9e8a77262821d0d5","observation_id":"7f76c21b-a567-4958-a36d-a0d46904e11d","resolution":{"observed_at":"2026-08-03T21:13:54.447436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:54.542483Z","title":"Arima models to forecast next-day elec- tricity prices.IEEE transactions on Power Systems, 18(3): 1114–1121, 2003","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:54.542483Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:2603d7328056677ea78e655c95176fb458e4cbfa207178343c87954952403035","observation_id":"44927e64-5b6e-4295-9014-9138f7e8fbad","resolution":{"observed_at":"2026-08-03T21:13:54.542483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03912","last_updated":"2025-05-06T18:35:07Z","snapshot_observed_at":"2026-07-06T21:19:58.642378Z","submitted_at":"2025-05-06T18:35:07Z","title":"OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03912","snapshot_observed_at":"2026-08-03T21:13:54.666710Z","title":"Openhelix: A short survey, empirical anal- ysis, and open-source dual-system vla model for robotic ma- nipulation.arXiv preprint arXiv:2505.03912, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:54.666710Z"},"links":{"cited_paper":"/paper/2505.03912","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:bdb2e101c41fda5005c1ab256a39c743c0933310113b43889d9c9ad6b6e2da8a","observation_id":"d0b9cbd5-33a6-4c81-b5c1-cb020051985e","resolution":{"observed_at":"2026-08-03T21:13:54.666710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:54.846056Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344–16359, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:54.846056Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:832e38cd470ebc8d5b1d18d14981759c67cc563b8c72ac5a95be1a8a23b949c4","observation_id":"6a6f67cf-9d64-49ac-8e0e-dbe3786d2002","resolution":{"observed_at":"2026-08-03T21:13:54.846056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:54.986243Z","title":"Foundation models in robotics: Applications, challenges, and the future.The International Journal of Robotics Research, 44(5):701–739,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:54.986243Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:a60a863ac468117e85af9cbf46847404c9c249f22c2dfa41bc1168036d85bc8e","observation_id":"dbb1e2cc-83c9-4ff1-b6e9-49cfd68bec7c","resolution":{"observed_at":"2026-08-03T21:13:54.986243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:55.120484Z","title":null,"venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:55.120484Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:132b89bef0f42b80e5db8f378be40d94759c97a3b2ceebf975ad7d6c949446ac","observation_id":"35f5b705-cad5-49e0-808c-aca6e1c5ae43","resolution":{"observed_at":"2026-08-03T21:13:55.120484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:55.302122Z","title":"Exponential smoothing: The state of the art—part ii.International journal of forecasting, 22(4): 637–666, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:55.302122Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:539da74147600876b6a55583711f95b66e2ed0a58f0a966c7b6b9b6056fd71ae","observation_id":"905315cf-9604-4888-9ca3-82326d993387","resolution":{"observed_at":"2026-08-03T21:13:55.302122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-03T21:13:55.498913Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms.arXiv preprint arXiv:2310.01801, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:55.498913Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:554900c33203b5e63e0f20f4e7e39458081519aea79854fb3419c9bbe48008b3","observation_id":"2d2b3f30-c72e-40a4-880e-54f0689db79a","resolution":{"observed_at":"2026-08-03T21:13:55.498913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:55.705077Z","title":"Application of arima model for fore- casting of daily maximum temperature.MAUSAM, 69(2): 291–296, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:55.705077Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:5de9bb157f74f329fb55d6936e9189d3bfc63fb3cdbb13a593f8abefa48f5a09","observation_id":"f9ab8769-9c24-43b3-8a5a-613ea645c1a9","resolution":{"observed_at":"2026-08-03T21:13:55.705077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15549","last_updated":"2024-10-21T00:36:02Z","snapshot_observed_at":"2026-07-06T19:36:45.701678Z","submitted_at":"2024-10-21T00:36:02Z","title":"A Dual Process VLA: Efficient Robotic Manipulation Leveraging VLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15549","snapshot_observed_at":"2026-08-03T21:13:55.935229Z","title":"A dual process vla: Efficient robotic manipulation leveraging vlm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:55.935229Z"},"links":{"cited_paper":"/paper/2410.15549","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:5c110743f89ee1c6d0c9a5ed4f143de8001797fcf26777992cf0d2c1011e9cb7","observation_id":"76bce430-2e08-4cf2-8d40-1d487fc00c44","resolution":{"observed_at":"2026-08-03T21:13:55.935229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16815","snapshot_observed_at":"2026-08-03T21:13:56.020935Z","title":"Thinkact: Vision- language-action reasoning via reinforced visual latent plan- ning.arXiv preprint arXiv:2507.16815, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:56.020935Z"},"links":{"cited_paper":"/paper/2507.16815","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:750e5a891371b93f1409ef9dd66d254f791eb7356e20fb0c5ecc60e70a71ce76","observation_id":"57e376bb-4e45-42f1-91c8-6cb724594be6","resolution":{"observed_at":"2026-08-03T21:13:56.020935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:56.169578Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:56.169578Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:9627c1ce8df8e1cffa7dc016658721adc3bd6ea7bcb959ee6940caeaf69af071","observation_id":"ed791c84-ab0b-45c2-b7c2-20b7de49f960","resolution":{"observed_at":"2026-08-03T21:13:56.169578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:56.316181Z","title":"OTexts, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:56.316181Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:0fda724c93432b64c832a68abe1ee532e2306e1debb1e8ef511912f831c0c275","observation_id":"776dd8bb-01a4-4a90-bc50-2924b5caacbb","resolution":{"observed_at":"2026-08-03T21:13:56.316181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-03T21:13:56.462664Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:56.462664Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:ff3cb998257edfcdcd02df1ee678c123e1ab80f949e15598e930a6a49b616c94","observation_id":"7934f1b5-4156-4e3e-8d1b-107bd22a6162","resolution":{"observed_at":"2026-08-03T21:13:56.462664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-03T21:13:56.747553Z","title":"Fine-tuning vision-language-action models: Optimizing speed and suc- cess.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:56.747553Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:d43ecd79fe46c382c64a12e01d7188a2733fcf1afeda84420a3cf78e85d24e41","observation_id":"d5767508-8e7e-4919-a423-a1b18dd412fb","resolution":{"observed_at":"2026-08-03T21:13:56.747553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-03T21:13:56.896555Z","title":"Cogact: A foundational vision- language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:56.896555Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:c99605d04bc1483791992f01a34113213f3aada9f28de1a8018df10f66e642d4","observation_id":"dd7dfac0-5aee-4ef5-85e6-b94a5a7173eb","resolution":{"observed_at":"2026-08-03T21:13:56.896555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-03T21:13:57.062334Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:57.062334Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:7853344232130b65b46b3bc96e17c113fb328b4fc74b5e33ceca655f04037f73","observation_id":"7816679a-32e7-4762-ba51-ee9b28fac194","resolution":{"observed_at":"2026-08-03T21:13:57.062334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-03T21:13:57.157105Z","title":"Evaluating real-world robot manipulation policies in simulation.arXiv preprint arXiv:2405.05941, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:57.157105Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:bbf905225114eaaeec41f792983e720c00415fae1876fb9c7e8cc889b0903189","observation_id":"7ca6b994-fbb6-45b4-aaa2-d6c412525532","resolution":{"observed_at":"2026-08-03T21:13:57.157105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:57.283550Z","title":"Tgif: A new dataset and benchmark on animated gif description","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:57.283550Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:26046835140af054f051f03a26ed1dd4036a110877856483ee22dd2a7e8a66b0","observation_id":"2bc0f27b-f3b9-4cef-bb6b-dcd2eb6b6674","resolution":{"observed_at":"2026-08-03T21:13:57.283550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:57.409447Z","title":"Sp-vla: A joint model scheduling and token prun- ing approach for vla model acceleration.arXiv preprint arXiv:2506.12723, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:57.409447Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:f42434488d637552abf7d3236b93df218bebf16de53c952a5561ba165828f2f7","observation_id":"d03a8d31-dd15-43f8-97d6-001a4cede479","resolution":{"observed_at":"2026-08-03T21:13:57.409447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:57.611003Z","title":"Evo-1: Lightweight vision-language-action model with pre- served semantic alignment, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:57.611003Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:d77b998f369a8bd8b7c7fbc0f4c61d1311643ecd671264d7202fc74bbea41391","observation_id":"19356258-b13f-4186-bf1f-4cd782a13b5c","resolution":{"observed_at":"2026-08-03T21:13:57.611003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:57.792977Z","title":"Boosting multimodal large language models with visual to- kens withdrawal for rapid inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:57.792977Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:82948952120de23d78ecbf3ae19eb9350085b70d9dc7b965358fb654fbf14d19","observation_id":"0e1d00c2-cbe7-4225-9c3f-8dbda5f21156","resolution":{"observed_at":"2026-08-03T21:13:57.792977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:58.012908Z","title":"Libero: Benchmarking knowl- edge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:58.012908Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:67bce54c130ef18c3ba6a17470e03f9f78c008674ab8bfee621ca02ed62b0aac","observation_id":"19d3c730-3205-4afa-a043-8e955b0a73d6","resolution":{"observed_at":"2026-08-03T21:13:58.012908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:58.257420Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:58.257420Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:7aa71a61157b1e1c102602e539615cef6b34558dd53d5d5ea25e7d496435202b","observation_id":"ad7923a5-26ab-47bb-9d10-6b2cef09b2e6","resolution":{"observed_at":"2026-08-03T21:13:58.257420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:58.422734Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:58.422734Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:4098217b50334488442b82cae9a2cef102a39842773bad7ae7a0683d6d4d0acc","observation_id":"4a8c2edf-12b9-4858-8800-b6a19e29e746","resolution":{"observed_at":"2026-08-03T21:13:58.422734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-03T21:13:58.668633Z","title":"A survey on vision-language-action models for embodied ai.arXiv preprint arXiv:2405.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:58.668633Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:b43d3f38aaa70d146d0e90376f4db04d6461dfc1610147a126916fdb4faef517","observation_id":"f55acff6-22a1-47b5-a79f-fac5646390d2","resolution":{"observed_at":"2026-08-03T21:13:58.668633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23455","last_updated":"2025-03-30T14:23:18Z","snapshot_observed_at":"2026-08-06T07:28:36.426777Z","submitted_at":"2025-03-30T14:23:18Z","title":"Efficient Token Compression for Vision Transformer with Spatial Information Preserved","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23455","snapshot_observed_at":"2026-08-03T21:13:58.880803Z","title":"Efficient token compression for vision trans- former with spatial information preserved.arXiv preprint arXiv:2503.23455, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:58.880803Z"},"links":{"cited_paper":"/paper/2503.23455","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:f8596280ef6e32a32312ec738b8f84c7381cbd4116e74296e343c5e2e1f9f06a","observation_id":"62b7b23f-dccd-4429-9718-bd66e1e90142","resolution":{"observed_at":"2026-08-03T21:13:58.880803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:59.045043Z","title":"Prune and merge: Efficient token compression for vision transformer with spatial infor- mation preserved.IEEE Transactions on Multimedia, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:59.045043Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:4ad7fbf3a5795fd29f0665fdc196c2e2c98c7e43c5ef1974e317e4d009000cf2","observation_id":"f7542731-dc4f-4724-a060-1dfc10724a08","resolution":{"observed_at":"2026-08-03T21:13:59.045043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:59.158654Z","title":"A review on discrete diversity and dis- persion maximization from an or perspective.European Journal of Operational Research, 299(3):795–813, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:59.158654Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:8017f63765a20e81ba66331580dd1d9dfec0aff785db5113b7d3bbf5d46649e7","observation_id":"06e66336-5d1d-4c61-bb8a-bc2b587f59e6","resolution":{"observed_at":"2026-08-03T21:13:59.158654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:59.269592Z","title":"Eog signal modeling using double exponential smoothing for robot arm control system.Kurdistan Journal of Applied Research, 1(3):6–10, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:59.269592Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:0d37f3f127f6df12babe79087da284bc5b70fb0fe0c39e103ed8dbc1f6a36d01","observation_id":"50416b6c-4386-4944-a84d-a45788eb7c9c","resolution":{"observed_at":"2026-08-03T21:13:59.269592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:59.398579Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:59.398579Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:e11266a12404bd3db26e1fe9647e7f058bc1c370234c44fde3aaf651da663b6b","observation_id":"e0deb0cb-dcbb-4719-bc44-80e53e579d01","resolution":{"observed_at":"2026-08-03T21:13:59.398579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01034","last_updated":"2024-12-02T01:33:49Z","snapshot_observed_at":"2026-08-05T18:49:54.781310Z","submitted_at":"2024-12-02T01:33:49Z","title":"Quantization-Aware Imitation-Learning for Resource-Efficient Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01034","snapshot_observed_at":"2026-08-03T21:13:59.533390Z","title":"Quantization-aware imitation-learning for resource- efficient robotic control.arXiv preprint arXiv:2412.01034,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:59.533390Z"},"links":{"cited_paper":"/paper/2412.01034","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:1e5dc1a547fd53d4d9042610ac2102271f0d5aeb9d9db1e76c7c97424611a3d2","observation_id":"869a3651-abe3-40c9-b3d8-12900194fd3d","resolution":{"observed_at":"2026-08-03T21:13:59.533390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:59.742159Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:59.742159Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:375530d3974f0922d4c5dbf23072d60e6279ffee3ca4d8e1893acf9396228396","observation_id":"9e77ebed-6f69-4937-a551-02152f10e307","resolution":{"observed_at":"2026-08-03T21:13:59.742159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:59.863759Z","title":"Empirical macroeco- nomic modelling for policy analysis.The Oxford Handbook of Economic Forecasting, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:59.863759Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:5a218e0bb79196609d74841c412745b70f7b0f468da897f4d4cbcd09e749d725","observation_id":"b6e82c46-bdd0-4007-843f-6f64505d4871","resolution":{"observed_at":"2026-08-03T21:13:59.863759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:13:59.943585Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:59.943585Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:85544c004876f5cf8a876371217942d526f9b67303045813c572767aea3373b5","observation_id":"5589f6ec-f8f7-4417-9306-7b56d26e492b","resolution":{"observed_at":"2026-08-03T21:13:59.943585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:00.017215Z","title":"A simple and effective algorithm for the maxmin diversity problem.Annals of Operations Research, 186(1):275–293,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:00.017215Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:23fa63ba332652aa97440e789e553a6054f93248afa20da6d29a2c91728e9644","observation_id":"880a4a78-742d-4354-9374-e884a44f3bae","resolution":{"observed_at":"2026-08-03T21:14:00.017215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:00.262384Z","title":"Grasp and path relinking for the max–min diversity problem.Computers & Operations Research, 37 (3):498–508, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:00.262384Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:16c88f1a84aae5d1cb7627ac6c2d70c44d1331f89413deff3703e36e6fcd6285","observation_id":"1717950f-2ac7-4801-8a9d-b8669ac354a6","resolution":{"observed_at":"2026-08-03T21:14:00.262384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:00.438884Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models.arXiv preprint arXiv:2403.15388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:00.438884Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:5d22846728c2f22b803c4d3cb68642a2b5cdd2e7cab4dfe6a103e7b78f960f93","observation_id":"359cc67a-867d-4a60-83e5-d5b1aef7eebf","resolution":{"observed_at":"2026-08-03T21:14:00.438884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:00.549066Z","title":"The empirical case for two systems of reasoning.Psychological bulletin, 119(1):3, 1996","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:00.549066Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:2f66f657cd5f66d710b1bfb3461ab625177db0c38e7530ac134bb885ebe69e89","observation_id":"67650591-946f-4f66-ba2a-9ccaee522df5","resolution":{"observed_at":"2026-08-03T21:14:00.549066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-03T21:14:00.705370Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:00.705370Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:492f267c879f74066693eebbcdcf6eb790c4b6bfc2ccc16f34a5486a56d5a3f6","observation_id":"75ed1a02-0afd-416b-b93f-805c4fe91e6c","resolution":{"observed_at":"2026-08-03T21:14:00.705370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05614","last_updated":"2026-05-24T09:40:18Z","snapshot_observed_at":"2026-08-05T05:16:29.042947Z","submitted_at":"2025-09-06T06:22:19Z","title":"SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.05614","snapshot_observed_at":"2026-08-03T21:14:00.801346Z","title":"Specprune-vla: Accelerating vision-language- action models via action-aware self-speculative pruning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:00.801346Z"},"links":{"cited_paper":"/paper/2509.05614","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:9964e52a7e98d4053e82342f7f2f86f810fe900e79b46f43512ba01e618c03e1","observation_id":"3e4abb21-c177-4996-9aa2-3e69f4e1caff","resolution":{"observed_at":"2026-08-03T21:14:00.801346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:00.875153Z","title":"Tinyvla: Towards fast, data-efficient vision- language-action models for robotic manipulation.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:00.875153Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:9ab52fe753eaa2e43c034d509864dbcfbd105955678621f62cf95640f256ef37","observation_id":"e06c39cc-e4a6-439e-9558-234babef7436","resolution":{"observed_at":"2026-08-03T21:14:00.875153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:00.977431Z","title":"Forecasting seasonals and trends by expo- nentially weighted moving averages.Management science, 6(3):324–342, 1960","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:00.977431Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:87e02991e0710eab21e76f91361b9d2957bd4db27b91992b0c4b825a0e91fc0f","observation_id":"28c49101-3c7e-4802-babd-5ad70ed90bb7","resolution":{"observed_at":"2026-08-03T21:14:00.977431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-03T21:14:01.173554Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy re- duction.arXiv preprint arXiv:2410.17247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.173554Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:5b8a16d64ca75e78807a21a90fdaa91759a3aaeaf47dc46885fe322d013a8c1c","observation_id":"9c415a1b-a7f4-49ae-9b5c-8e17fb3d699c","resolution":{"observed_at":"2026-08-03T21:14:01.173554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:01.231594Z","title":"Video question answer- ing via gradually refined attention over appearance and mo- tion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.231594Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:64bc5cc2e08d046cb0fb87229d76b2bcdeb41b6ebb18cf3f3861d41bab6489c2","observation_id":"fd8f6a09-6348-45be-a579-39c188ce6d35","resolution":{"observed_at":"2026-08-03T21:14:01.231594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:01.307967Z","title":"Vla-cache: Efficient vision- language-action manipulation via adaptive token caching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.307967Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:2b13e27a30e1f6f3b7f51458d7e5cf5eae52a9427c9d18fcb2cd42c478106770","observation_id":"4ec9c681-d72e-4c98-adb0-e8c267f02693","resolution":{"observed_at":"2026-08-03T21:14:01.307967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:01.427269Z","title":"EfficientVLA: Training-free acceleration and com- pression for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.427269Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:fbfaade38839bd98ba553b818f1b432b845449a865988d265f53965309859b2f","observation_id":"4be9b7c8-3b0a-49ab-894d-67778610a006","resolution":{"observed_at":"2026-08-03T21:14:01.427269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:01.543512Z","title":"Fit and prune: Fast and training-free visual token pruning for multi- modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.543512Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:913aaa918b3cb8e97ee84c003d2b37889b84885753b33556af13173ff7a85fed","observation_id":"b81a8881-a0df-424e-975b-c8c0750684e5","resolution":{"observed_at":"2026-08-03T21:14:01.543512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:01.706653Z","title":"A survey on efficient vision-language-action models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.706653Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:5df478b360d21b24ae17bf0c441077cc0c9c34348101e6974942be82652ef542","observation_id":"4221a2b1-0d2e-4d4f-a8c5-f9c1957f29c2","resolution":{"observed_at":"2026-08-03T21:14:01.706653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:01.815488Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution.Advances in Neural Information Processing Systems, 37:56619–56643, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.815488Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:dbc696161bf5f88efc916998db5a07e62fec335d5e6627ab80ad0b7cc4c7a7f4","observation_id":"9f2306d0-3252-4b81-affa-ba7a1a35e760","resolution":{"observed_at":"2026-08-03T21:14:01.815488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-03T21:14:01.887983Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference.arXiv preprint arXiv:2410.04417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.887983Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:602173a9542ca7f6b14e8fd2186224ecd2dc3ec495958ece418b7bcd5340d0a5","observation_id":"6a3ef22d-aed3-4c3e-a224-a53f6ea7211e","resolution":{"observed_at":"2026-08-03T21:14:01.887983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:01.967848Z","title":"H2o: Heavy-hitter ora- cle for efficient generative inference of large language mod- els.Advances in Neural Information Processing Systems, 36: 34661–34710, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:01.967848Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:49bad84c10cfee1cd2a2298b43f6bbabd4f27fb0d950070aa1927cb296a8d9f2","observation_id":"2eb5f061-9989-49ad-8165-6dbda3e917aa","resolution":{"observed_at":"2026-08-03T21:14:01.967848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:02.069112Z","title":"Cot-vla: Visual chain-of-thought rea- soning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:02.069112Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:f3d3710c7685397585bb6df1f9395e210e9b6acd8b1754766d7176c8a5243fce","observation_id":"7823c72f-9e8f-45ee-89b1-6ed27e8713f8","resolution":{"observed_at":"2026-08-03T21:14:02.069112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:02.239106Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:02.239106Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:077df2cc53f7b1e09b2ac717486093217c7b3e4d29e3f01f951900e063c529b0","observation_id":"85dea76b-7c6e-4575-ada1-45ffb7fbb0b8","resolution":{"observed_at":"2026-08-03T21:14:02.239106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:14:02.361658Z","title":"highlighted tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:02.361658Z"},"links":{"citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:9213f6ca5cb57caf43859d79407e90a90e66b277409fb0869532baf254dc6265","observation_id":"bb3d0ee1-30fa-497e-a58f-e20864894eb9","resolution":{"observed_at":"2026-08-03T21:14:02.361658Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 10 inbound Pith citation observations for arXiv:2511.16449."}