{"as_of":"2026-08-06T02:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad011d43863b5a3a6bda2ad15884badb1fb6a5e486a9963e6e1558958c1b97c6","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T08:52:31.686474Z","state":"measured"},{"denominator":173,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":173,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":316,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:50:41.801028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T06:12:19.643111Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2501.15830"},"observation_digest":"sha256:c881fa5cfd93aa3e732289f173cd2156cf3a8945e1d64c1b041cde2c293e821a","observation_id":"3c17340d-0043-4f36-a7e6-03d4a668d1f0","resolution":{"observed_at":"2026-05-12T06:12:19.840291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:48.725800Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2502.05855"},"observation_digest":"sha256:61c88091c1498363410425de61afe3268e180dbde7d325dafd48468e5e1e762d","observation_id":"c177e2c1-4370-407b-86d3-c32632cc9b07","resolution":{"observed_at":"2026-05-14T19:48:49.064333Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:1b15058201f006fc8fbe1519c9a12a8cb1f5417ba3866ada9399c32ed7402dfd","observation_id":"432d5666-6801-4c84-88bc-4e89fa89b527","resolution":{"observed_at":"2026-05-15T22:53:37.233298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:c66d800ea835808fb8d76b9431045e55a72997cc225b7bce7572af253fdfee01","observation_id":"e1190dcc-6d96-4cf3-96ff-2a9be3cf739c","resolution":{"observed_at":"2026-05-11T08:52:32.433811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T01:27:33.123243Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2503.03480"},"observation_digest":"sha256:b5c3d132e276eaeb44f2aa4dd20fceb9dafce4aefd8264e728e8f38d87ab6901","observation_id":"f78da1bd-03f3-4eb1-9027-821ab3f6391b","resolution":{"observed_at":"2026-05-23T01:32:22.553145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:fa2eaf2ff59b17fc22cd7689c86ecf9c7fc1ab729d28680d67332937519a4f36","observation_id":"0b31a95a-8506-4798-b973-785e19acce9d","resolution":{"observed_at":"2026-05-15T22:00:48.842942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T15:53:29.412890Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2504.19854"},"observation_digest":"sha256:80322894e522190aa09cf2e956613b486bbaeec437d3c37cb97556b41d355965","observation_id":"20008719-ae60-4e23-baf5-b47dee0db4db","resolution":{"observed_at":"2026-05-16T15:53:29.476407Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2505.13255","last_updated":"2026-04-24T03:20:34Z","snapshot_observed_at":"2026-07-06T21:26:20.811742Z","submitted_at":"2025-05-19T15:39:08Z","title":"Policy Contrastive Decoding for Robotic Foundation Models","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T14:09:48.762737Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.13255"},"observation_digest":"sha256:6c269dbaa1a10889a452d741b0f9d0d6018e5e795f40611babb146fac4c0ea54","observation_id":"74dd22fd-a4a0-41d6-a649-ec3271b9cf9c","resolution":{"observed_at":"2026-05-22T14:11:38.557820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T15:59:08.846629Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.15659"},"observation_digest":"sha256:e882bfb9f42a1f8983236156fc3dc7c8b70215077ab68ab5c576b6be483501e6","observation_id":"a6e56e9e-e96c-40e7-83bf-857197eb6c07","resolution":{"observed_at":"2026-05-17T15:59:08.897738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T14:25:47.178714Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.17016"},"observation_digest":"sha256:02481ff07565bd1ecbc4289d06fa0b4d3c80993b02fbb645843c8de36b5f0e0b","observation_id":"a523c01d-a6c5-48eb-a79e-506e999fe7c4","resolution":{"observed_at":"2026-05-21T14:25:47.254494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:4febdae1b295626d42f66a6c56f62ca0ce0daf321d6083b71e87547e8be4b504","observation_id":"6990683a-0047-4f84-bd40-d34b0f706960","resolution":{"observed_at":"2026-05-16T12:55:40.496669Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:f05e8119f74dbb34ffc0b890287ef771ea499fef11321c45fb61f66051dfbb86","observation_id":"14c9ae98-a376-491f-8152-377b49fbaa14","resolution":{"observed_at":"2026-05-11T21:22:37.500199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:34a7316fb4c6abf12607f71c3b6511334a1719237659d2849df46c5d58546e8e","observation_id":"e8512285-7216-41cf-9287-43949bdc2555","resolution":{"observed_at":"2026-05-15T14:18:51.648607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2506.13757","last_updated":"2025-11-05T23:46:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T17:58:50Z","title":"AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-14T21:46:43.955825Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2506.13757"},"observation_digest":"sha256:103e3772b288363400103872ae77e7e262704a1d03eca588bb14bd1215854658","observation_id":"553badf2-5ebb-4667-9690-cfadccfa0be3","resolution":{"observed_at":"2026-05-14T21:46:44.180673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T22:57:07.883617Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2506.21539"},"observation_digest":"sha256:ef65c940c822f291995c5c90f15c65bfcd68a181d57fbbe3ff5ab5d439a99336","observation_id":"4330f603-7bf6-4bb5-93a0-158667a91944","resolution":{"observed_at":"2026-05-11T22:57:08.224546Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:6ce8130dc326dfff625105f95131d6206a0b1ae5fa9c76f714d0c56fdfaf761f","observation_id":"a189148d-5bb7-4167-b865-d57482b0d284","resolution":{"observed_at":"2026-05-17T14:08:35.401768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:f88b767e213a27afe797ad06d6d0d66311cdbf23e93521a847fac2fa0d39547e","observation_id":"aa644d30-0dab-443b-9c0f-b9cda949ddd7","resolution":{"observed_at":"2026-05-16T15:42:41.493612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2507.12768","last_updated":"2026-05-06T08:19:11Z","snapshot_observed_at":"2026-08-03T01:37:13.706745Z","submitted_at":"2025-07-17T03:48:57Z","title":"AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T03:52:18.984005Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2507.12768"},"observation_digest":"sha256:e04fb802745bc57499fba0339b0c79570f3d5382c42d3f2af895835a5f01d7f4","observation_id":"ddd62206-4c0b-46d1-95b6-60a2f4ee14bc","resolution":{"observed_at":"2026-05-19T03:52:57.504899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-07-06T22:00:18.950986Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:b26d3513d181d2c68276e83e58b1b4d07cd66dbe6758acc16582f066bb76ee34","observation_id":"5130156d-0f88-40e8-bed6-72e2c2798d39","resolution":{"observed_at":"2026-05-17T08:04:12.517032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T21:52:02.893886Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2507.23682"},"observation_digest":"sha256:ea46ed52a718230f78128e784d724269533d453041c159fde72cc464d95f859b","observation_id":"df4247d9-d154-4a04-b7b0-c36570efb474","resolution":{"observed_at":"2026-05-15T21:52:03.141334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T22:50:41.801028Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06426","last_updated":"2025-08-08T16:14:01Z","snapshot_observed_at":"2026-08-05T22:50:39.090909Z","submitted_at":"2025-08-08T16:14:01Z","title":"Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:50:41.801028Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2508.06426"},"observation_digest":"sha256:95e7f565d0a0941e32e3d843506c35aaab08b03ef76cce5fad1f2e7aea3f9f5a","observation_id":"3d3b6de8-131b-4fac-b7d6-dbdf8484c861","resolution":{"observed_at":"2026-08-05T22:50:41.801028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T22:46:40.308345Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06429","last_updated":"2025-08-08T16:16:43Z","snapshot_observed_at":"2026-08-05T22:46:26.310165Z","submitted_at":"2025-08-08T16:16:43Z","title":"SPARSE Data, Rich Results: Few-Shot Semi-Supervised Learning via Class-Conditioned Image Translation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:46:40.308345Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2508.06429"},"observation_digest":"sha256:e24b1d626b88a124a28f3c00a14165e5aab1b47f4da15d4ac0a2bf18ea186faa","observation_id":"c21acd47-108b-4c5f-ad97-5d857a743863","resolution":{"observed_at":"2026-08-05T22:46:40.308345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T21:44:56.932807Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08113","last_updated":"2025-08-11T15:53:23Z","snapshot_observed_at":"2026-08-05T21:44:53.988566Z","submitted_at":"2025-08-11T15:53:23Z","title":"AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:44:56.932807Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2508.08113"},"observation_digest":"sha256:0ed9f1929795a04fe735e02282c02072d89480db6480d6137ef982bb5dc5f263","observation_id":"4bf4ec52-6e7e-4051-8af1-9339e43fcccb","resolution":{"observed_at":"2026-08-05T21:44:56.932807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T20:35:45.915628Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-05T20:35:42.234950Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:45.915628Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:5335cb4e82df3ad960cca74e7c9c2d226acb43dbe156b95fb89c56d9619a3f97","observation_id":"957ef696-5bca-4bed-9f3c-ac4dd53f3b93","resolution":{"observed_at":"2026-08-05T20:35:45.915628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T20:38:42.966861Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-05T20:38:36.897476Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:42.966861Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:6a0995908dc66d494b881905dffff56005fcc8eb9d42f643b4f5eb8eb3bfbc10","observation_id":"bd557c63-484d-40f1-856b-a2b5012b244e","resolution":{"observed_at":"2026-08-05T20:38:42.966861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T20:31:48.143380Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-05T20:44:28.806636Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:48.143380Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:943334e2c46b6037d8b74298d86b425f6b3369c2060acdd28aa374145a573682","observation_id":"61a8e01b-d9bf-4685-9cb5-d77a6979d8e9","resolution":{"observed_at":"2026-08-05T20:31:48.143380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T16:55:52.189100Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17449","last_updated":"2025-09-04T16:46:34Z","snapshot_observed_at":"2026-08-05T16:55:50.271610Z","submitted_at":"2025-08-24T17:01:15Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:52.189100Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2508.17449"},"observation_digest":"sha256:7821c6a7831d3b3538800a6fbe600a34b1779fc99edf1161d5562f70c2a01a47","observation_id":"4e33c551-7fab-42c5-bc95-867a4a125250","resolution":{"observed_at":"2026-08-05T16:55:52.189100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T20:43:24.417901Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2508.19236"},"observation_digest":"sha256:6212195bdfb4d0628068a9204cfbe03bdf023eaaca78e0e2021ffcff82336918","observation_id":"4c7d7538-4911-4813-b2db-7f81eeaad77d","resolution":{"observed_at":"2026-05-15T20:43:24.519745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T14:42:32.725953Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.725953Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:2a9b5da00f3a91c33406d5169c79e03f90ab38ca2d054b2d60870490dbd3a4ea","observation_id":"ecbac68c-3f86-4700-a0b6-05c1aa1d1bf1","resolution":{"observed_at":"2026-08-05T14:42:32.725953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T13:50:17.405514Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00328","last_updated":"2025-08-30T03:01:57Z","snapshot_observed_at":"2026-08-05T13:50:16.414260Z","submitted_at":"2025-08-30T03:01:57Z","title":"Mechanistic interpretability for steering vision-language-action models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:50:17.405514Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.00328"},"observation_digest":"sha256:69565360b3f58bfb2bb5662416db38e8dafc9c818a3da7ad9f57fd2aa96378ca","observation_id":"99d155fb-1462-4ecf-86ab-dfdaf40e4073","resolution":{"observed_at":"2026-08-05T13:50:17.405514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T13:31:09.933298Z","title":"Fast: Efficient action tokenization for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-05T13:31:08.573875Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:31:09.933298Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.00576"},"observation_digest":"sha256:30a241fb61b4cdb000295addf3da7784031d18c252c721c9e8792245529a7ff2","observation_id":"d71fa393-e759-4444-b8d8-e12ec46b78aa","resolution":{"observed_at":"2026-08-05T13:31:09.933298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T12:02:28.300757Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02055","last_updated":"2025-09-05T06:24:50Z","snapshot_observed_at":"2026-08-05T12:02:25.039196Z","submitted_at":"2025-09-02T07:51:59Z","title":"Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:02:28.300757Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.02055"},"observation_digest":"sha256:5fb568699b7055d054119b5204e31e8540abc74025d9bbe2d4d701b1ae9ccbb4","observation_id":"87117c1b-5aed-4d9f-a546-1a2317f3df49","resolution":{"observed_at":"2026-08-05T12:02:28.300757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T05:48:48.107487Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-08-05T05:48:44.865688Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T05:48:48.107487Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.04996"},"observation_digest":"sha256:60eda20671879281ea656b293220a5bee4ef737b3fdb597d4502fc084ab9e0e7","observation_id":"439805ee-919d-4ebb-ad27-10464cb11206","resolution":{"observed_at":"2026-08-05T05:48:48.107487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T12:42:46.978148Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.06951"},"observation_digest":"sha256:ac6d7a5980af346bd698f0cd04b009d5708efefe7792d7a4025226bb42c90a73","observation_id":"5f748370-c075-4b89-bc33-0ce4e1404976","resolution":{"observed_at":"2026-05-16T12:42:47.062488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T21:29:09.427398Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07962","last_updated":"2025-09-09T17:50:37Z","snapshot_observed_at":"2026-08-04T21:29:05.648300Z","submitted_at":"2025-09-09T17:50:37Z","title":"TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T21:29:09.427398Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.07962"},"observation_digest":"sha256:4fdbac76c10a3e62c512c2b5424046121a8c27eb2e1802d0fc85242d3d735542","observation_id":"46dee853-bb34-49b8-b5b4-1db200593787","resolution":{"observed_at":"2026-08-04T21:29:09.427398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T20:10:13.383967Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08820","last_updated":"2025-09-10T17:52:09Z","snapshot_observed_at":"2026-08-04T20:10:11.887304Z","submitted_at":"2025-09-10T17:52:09Z","title":"RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:10:13.383967Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.08820"},"observation_digest":"sha256:a8e9ea476e383f1f7695aaba0fecc46215e03642ece26d7e48dd0a1d67a4f9aa","observation_id":"cff1b3eb-0556-428f-9437-8e359a293b07","resolution":{"observed_at":"2026-08-04T20:10:13.383967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T16:17:25.976904Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.976904Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:092bb793d63e832c33f24cce8d7b37e84a059bea0e8d07bfe3aa811bfdfb2d44","observation_id":"90e33f91-4bd9-483b-87a4-aa566715af39","resolution":{"observed_at":"2026-08-04T16:17:25.976904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2509.21723","last_updated":"2026-05-01T09:02:01Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T00:47:39Z","title":"VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T13:47:30.943307Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.21723"},"observation_digest":"sha256:562a62e09725c95214e85e011b206972ce41fa76a5b29ea3f1122299f9ca8dfe","observation_id":"2e7e6cae-fae1-4465-9325-d976b76eb960","resolution":{"observed_at":"2026-05-18T13:51:25.745416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2509.24948","last_updated":"2026-04-27T05:41:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T15:45:19Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T12:48:32.123998Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2509.24948"},"observation_digest":"sha256:0171b2c005e9a466bf0317b2e6ad33dc868699a93d88339692eeda4d1aa172cd","observation_id":"193d796d-07f2-4d6b-aee5-002dfeeb6fd2","resolution":{"observed_at":"2026-05-18T12:51:23.523541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T14:58:37.522955Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00037","last_updated":"2026-07-27T06:20:18Z","snapshot_observed_at":"2026-08-04T14:58:34.574750Z","submitted_at":"2025-09-26T14:42:23Z","title":"RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T14:58:37.522955Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.00037"},"observation_digest":"sha256:78bb89746747bc0935c4eac9409f1df539e4e62cbcd0d2d9b6528a432374fdfe","observation_id":"0de6fb67-aa8b-45f4-8da8-a62bb926f755","resolution":{"observed_at":"2026-08-04T14:58:37.522955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T12:59:12.684224Z","title":"FAST: efficient action tokenization for vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01389","last_updated":"2026-05-24T16:18:14Z","snapshot_observed_at":"2026-08-04T14:09:35.781731Z","submitted_at":"2025-10-01T19:22:48Z","title":"INSIGHT: INference-time Sequence Introspection for Generating Help Triggers in Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T12:59:12.684224Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.01389"},"observation_digest":"sha256:5cba387298cb4a74d57c12808277ca7af65166112b81fcb10a0d86fe3358a3a9","observation_id":"287b5301-89a9-43ae-9f5d-424e6a6fde02","resolution":{"observed_at":"2026-08-04T12:59:12.684224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T12:55:08.056099Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:08.056099Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:ed7a19c34c8fe3b460cfcc0a72d3d9c9d5614166639566a9eee3e548bc1cc387","observation_id":"ebc4c4b4-72dd-4335-bef4-e9d2bf973cff","resolution":{"observed_at":"2026-08-04T12:55:08.056099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T11:20:12.458075Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.05681","last_updated":"2026-07-04T15:45:15Z","snapshot_observed_at":"2026-08-04T11:20:10.610981Z","submitted_at":"2025-10-07T08:38:08Z","title":"Verifier-free Test-Time Sampling for Vision-Language-Action Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T11:20:12.458075Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.05681"},"observation_digest":"sha256:8e6cde08081fbbb24eb82e02b409b81ed67be06d50de251fccf945bf5d1a3668","observation_id":"79e7768f-f511-4db8-a540-5ded61693a00","resolution":{"observed_at":"2026-08-04T11:20:12.458075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T10:44:36.206030Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08807","last_updated":"2026-07-04T03:31:36Z","snapshot_observed_at":"2026-08-04T10:44:29.379805Z","submitted_at":"2025-10-09T20:43:27Z","title":"Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T10:44:36.206030Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.08807"},"observation_digest":"sha256:7d681e710cd413b99345a40165d927fd20f45795648dbb681bc02a9d819e7911","observation_id":"62bff911-0d1e-4e43-bc97-ef5521b9c79c","resolution":{"observed_at":"2026-08-04T10:44:36.206030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T10:24:57.896357Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09976","last_updated":"2026-06-25T14:25:12Z","snapshot_observed_at":"2026-08-04T10:24:54.103532Z","submitted_at":"2025-10-11T03:11:18Z","title":"Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T10:24:57.896357Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.09976"},"observation_digest":"sha256:16f2ba7263d0026f3e14efcae156d011a74f23ea844897e44bc568429550cf3a","observation_id":"edf9e0ab-06cc-4ebb-9615-0da54e91ebae","resolution":{"observed_at":"2026-08-04T10:24:57.896357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T01:14:10.174044Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.10125"},"observation_digest":"sha256:e365b67dcebfe3194fc974c1b233986a7816c7c545a4334d47b0ac28734c7869","observation_id":"e68e9b60-6f35-4c6c-8d4f-e658c700d96d","resolution":{"observed_at":"2026-05-16T01:14:10.514253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2510.12796","last_updated":"2025-12-18T07:25:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-14T17:59:47Z","title":"DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T06:48:00.943591Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.12796"},"observation_digest":"sha256:1de1345e6075338c19317b201872e98e8a33f4cd6878043a080701c21d41048f","observation_id":"f0ab2c21-24d0-405a-a98e-ed8f47ca68e0","resolution":{"observed_at":"2026-05-17T06:48:01.082599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:f429efbb91c2a0e5e8679c6190d9eff1b0c8b51cd9fc338ee430d94e98092750","observation_id":"39461b7e-6354-4ea3-aa17-8eaaa2a13d30","resolution":{"observed_at":"2026-05-14T20:09:39.861416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-04T09:08:14.854816Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17111","last_updated":"2025-10-23T15:06:39Z","snapshot_observed_at":"2026-08-04T09:08:06.048583Z","submitted_at":"2025-10-20T02:59:45Z","title":"Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T09:08:14.854816Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.17111"},"observation_digest":"sha256:3fa80a732d39c04f576c2fbbedddb5ea508a44191a8feb10c5a651e2596b1544","observation_id":"a1a160eb-83f9-4afc-b7b9-b8bc5f6f352d","resolution":{"observed_at":"2026-08-04T09:08:14.854816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2510.24211","last_updated":"2026-05-05T17:15:37Z","snapshot_observed_at":"2026-07-06T22:34:13.674208Z","submitted_at":"2025-10-28T09:26:27Z","title":"Speculative Coupled Decoding for Training-Free Lossless Acceleration of Autoregressive Visual Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T03:20:35.021120Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2510.24211"},"observation_digest":"sha256:eaf3015e119d3a932fec981296f7068217c291015a58e0ce5ebce2be49c44b06","observation_id":"72f02667-d3bd-4e7a-9ff9-d0d050a2785e","resolution":{"observed_at":"2026-05-18T03:20:48.684648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2511.02239","last_updated":"2026-05-21T21:13:30Z","snapshot_observed_at":"2026-08-01T16:12:14.053996Z","submitted_at":"2025-11-04T04:02:51Z","title":"LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T07:34:55.240907Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2511.02239"},"observation_digest":"sha256:9f5edb077a698722571c806ccd260f4a52607ece58a81755d064aac614483233","observation_id":"90750e1c-e854-4de1-8a6f-05946be50bdd","resolution":{"observed_at":"2026-05-25T07:35:27.906366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2511.06754","last_updated":"2026-05-06T07:00:01Z","snapshot_observed_at":"2026-07-29T01:21:11.279990Z","submitted_at":"2025-11-10T06:33:44Z","title":"SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T00:22:41.611893Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2511.06754"},"observation_digest":"sha256:32ca49335cf96a4a3b51092091e2806b02dede4cec84f814d3d2e7ca32e228e4","observation_id":"0b6dfa7c-d79a-441e-b759-72be7aa7a3ba","resolution":{"observed_at":"2026-05-18T00:25:32.989265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T21:28:18.630934Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2511.14148"},"observation_digest":"sha256:f5cb34185627c2db95c2f5c4c0349e06ee0069f2538426ac7b35cd2de62c4f10","observation_id":"00c6d782-afb3-41f0-96ca-d67350f92265","resolution":{"observed_at":"2026-05-17T21:30:18.279960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2511.17411","last_updated":"2026-04-27T17:16:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T17:09:43Z","title":"SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T20:21:12.375936Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2511.17411"},"observation_digest":"sha256:4a8766b6878e05609b3685bfa31984c23f7f1fcf88d843627ce5a348ffce5baa","observation_id":"5e0fcc0a-341c-4338-bf45-cb8dd4e1cd8f","resolution":{"observed_at":"2026-05-17T20:22:04.607173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T20:59:52.110751Z","title":"FAST: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:52.110751Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2511.17502"},"observation_digest":"sha256:500a255be735cd27a686b2d6cb6453b2a150182c58f3001cf72753b468e9f8d2","observation_id":"dc291951-9c29-49b9-b360-0ed466e93021","resolution":{"observed_at":"2026-08-03T20:59:52.110751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2511.18960","last_updated":"2026-04-10T05:31:27Z","snapshot_observed_at":"2026-08-05T07:51:27.008234Z","submitted_at":"2025-11-24T10:22:28Z","title":"AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T06:28:22.652509Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2511.18960"},"observation_digest":"sha256:34684ef1b102228c27b57bf7aa9424da5222680ec5a9956b4c7bd5829c5f1711","observation_id":"2dd1631e-8d20-4d39-a5ff-adaca0501b58","resolution":{"observed_at":"2026-05-17T06:29:09.932906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T20:32:28.585704Z","title":"Fast: Efficient action tokenization for vision- language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19433","last_updated":"2026-05-29T16:37:52Z","snapshot_observed_at":"2026-08-03T20:32:24.421072Z","submitted_at":"2025-11-24T18:59:51Z","title":"Mixture of Horizons in Action Chunking","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:32:28.585704Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2511.19433"},"observation_digest":"sha256:6576c2872ca8c7d803c421c701d97d0a0f332c767082d8cdf7bb3311ff25271d","observation_id":"28178c42-aeb1-40bc-8033-01a9d1997d73","resolution":{"observed_at":"2026-08-03T20:32:28.585704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T14:00:20.802389Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.802389Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:449b6619a94a660f2c9e3f407426088a1948234acb240c99e278278a251e45dc","observation_id":"a8884fcb-8c89-4f58-b5b6-ee2dd654999b","resolution":{"observed_at":"2026-08-03T14:00:20.802389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2512.22519","last_updated":"2026-04-24T04:40:53Z","snapshot_observed_at":"2026-07-06T22:40:12.666349Z","submitted_at":"2025-12-27T08:31:25Z","title":"Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T19:28:35.576661Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2512.22519"},"observation_digest":"sha256:45f7e0170f9c755d350daa0c3c4f0579efed7f71dc2c6babe5d780e96dcecf4b","observation_id":"1e649f92-2d80-4e7b-b914-4925b27d864e","resolution":{"observed_at":"2026-05-16T19:31:13.375451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T13:53:26.092436Z","title":"Fast: Efficient action tokenization for vision- language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.22539","last_updated":"2026-07-02T08:55:28Z","snapshot_observed_at":"2026-08-03T13:53:20.780083Z","submitted_at":"2025-12-27T09:40:54Z","title":"VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T13:53:26.092436Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2512.22539"},"observation_digest":"sha256:27cd7471d2f014ce577bfdd210db9a27f6076fefe3ab512453cc3cfdf5a3d49e","observation_id":"c65aa1f7-b389-4017-92a7-465d9e25a3f6","resolution":{"observed_at":"2026-08-03T13:53:26.092436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T13:29:47.926004Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-04T11:27:48.952895Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:47.926004Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:b04202284593304bb66980b2b8bfac41b5f7fb12a1c60d27f0c6618e7ba5384a","observation_id":"0065bab7-4218-4845-b536-8c89d63e06e6","resolution":{"observed_at":"2026-08-03T13:29:47.926004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T12:30:33.846355Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T12:30:33.846355Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2601.03309"},"observation_digest":"sha256:24122faccf7e4fe3365d948a075eb6f4066031af12411bbce1f6c0171de36acc","observation_id":"0d790f23-2631-4d05-b551-82bdf4dfa8d7","resolution":{"observed_at":"2026-08-03T12:30:33.846355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2601.04052","last_updated":"2026-04-20T16:27:40Z","snapshot_observed_at":"2026-07-06T22:41:01.254450Z","submitted_at":"2026-01-07T16:16:10Z","title":"Stable Language Guidance for Vision-Language-Action Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T16:21:18.449987Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2601.04052"},"observation_digest":"sha256:c754f90c662a153a7900f2b18c3789a27e3fa25616b17b7f337e04cb0a1672c5","observation_id":"063ca814-7ea0-4958-ac76-c7a1005d8d41","resolution":{"observed_at":"2026-05-16T16:23:05.294401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2601.16046","last_updated":"2026-04-26T10:16:39Z","snapshot_observed_at":"2026-07-06T22:42:43.581560Z","submitted_at":"2026-01-22T15:23:35Z","title":"DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T12:05:08.804472Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2601.16046"},"observation_digest":"sha256:80a95f3d8bc52c9fba1bd60fe7c3243a42b00dd29a9de893211837fa9c0d2c90","observation_id":"2ac26e8b-edd2-4aed-bd47-aa1b694e3992","resolution":{"observed_at":"2026-05-16T12:07:50.693252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2601.21971","last_updated":"2026-05-09T15:09:13Z","snapshot_observed_at":"2026-08-02T14:39:06.467349Z","submitted_at":"2026-01-29T16:50:14Z","title":"Supervised Mixture-of-Experts for Surgical Grasping and Retraction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T09:30:17.251223Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2601.21971"},"observation_digest":"sha256:2d7a7dee0834006963fa2cb56e718e75aaff0b2df56cde1cba41df36ca33864b","observation_id":"f6e8c49b-1f4f-41e9-9f9b-b548a1219b0d","resolution":{"observed_at":"2026-05-16T09:30:48.168225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T06:50:22.904022Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-04T05:57:33.604836Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.904022Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:a0874a5b708c1977408c70410599600cb3b2913b6f19b1c7ae1457b0880e8838","observation_id":"9c8d4159-35f2-4fb4-848f-eb7f6e40c2e7","resolution":{"observed_at":"2026-08-03T06:50:22.904022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.10503","last_updated":"2026-05-16T03:35:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-11T04:05:03Z","title":"Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T14:07:10.387869Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.10503"},"observation_digest":"sha256:250f13ad279aa4626f15d2b7b2ecf3b7f2c1a1038cf7df9ee555762db41f1543","observation_id":"ca02669e-59e7-4cf2-a841-51dbd3fae137","resolution":{"observed_at":"2026-05-21T14:10:13.391086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T03:11:52.645633Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.11236"},"observation_digest":"sha256:7208632afe08899cb4b2b617a5df808473325edf1d448061a849bd883cca59d2","observation_id":"ae4d161f-6ec2-4318-80e5-328138cf44c1","resolution":{"observed_at":"2026-05-16T03:12:11.859871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.12978","last_updated":"2026-05-17T13:09:20Z","snapshot_observed_at":"2026-08-05T03:16:35.662407Z","submitted_at":"2026-02-13T14:56:06Z","title":"Learning Native Continuation for Action Chunking Flow Policies","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T12:38:26.522838Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.12978"},"observation_digest":"sha256:9eaed4e5632ee19ecc20fbd0039a434e0b8743548fe842014cf1ca291951417c","observation_id":"b3be4d23-8927-472f-9f06-f2782764af10","resolution":{"observed_at":"2026-05-21T12:40:08.745158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T22:05:39.797848Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.13193"},"observation_digest":"sha256:c9715e22b3c6c2c5ef0d51f5a6f5f038ed9ae26108be1dbe5c2566d3ca856d8c","observation_id":"d38a70cd-7f3f-4f91-ab79-10108d364c10","resolution":{"observed_at":"2026-05-15T22:06:42.961391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T22:14:28.981293Z","title":"Fast: Efficient action tokeniza- tion for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-04T20:00:40.213674Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:28.981293Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.17659"},"observation_digest":"sha256:c7fe1524a56c9d4f60e0b113103b739b55f19bc5a4f56a7e96fa1cea30be0fa6","observation_id":"efdb2e1d-c66e-4073-a413-99ed4ad9b070","resolution":{"observed_at":"2026-08-02T22:14:28.981293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T12:58:30.777235Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.18532"},"observation_digest":"sha256:a3106ab351b6a933c5f4c891906f5671bb30e83eed59455a93b81d833b425f41","observation_id":"c2198c2b-e888-4d1f-b497-b45c68da367f","resolution":{"observed_at":"2026-05-21T13:00:09.805192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T13:04:30.544504Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:5c10471263731fde8d9d8eca1ec641f1ab4cec0efebed1b4fde57c25c844ad33","observation_id":"185ec468-d8ee-497a-bc6c-2be3224e419c","resolution":{"observed_at":"2026-05-21T13:05:09.935677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T21:37:13.747288Z","title":"Fast: Efficient action tokeniza- tion for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:13.747288Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:e5691421506c5a83cd4fb43aabc754f1bb7e7ed1f8e88e32fd4fcfea1db8e15b","observation_id":"58dc68ba-727b-4dc8-a9e4-3b0ed97a74f7","resolution":{"observed_at":"2026-08-02T21:37:13.747288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:a5ed6f49403560dfc4992adf6859e0378bf317f35524c6afaf5921e853ab5dbb","observation_id":"23e97b66-5306-47be-8230-9a484a30460b","resolution":{"observed_at":"2026-05-21T13:24:11.167016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2602.20309","last_updated":"2026-04-06T23:32:59Z","snapshot_observed_at":"2026-08-02T13:10:10.837199Z","submitted_at":"2026-02-23T19:55:54Z","title":"QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T20:20:10.435886Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2602.20309"},"observation_digest":"sha256:adce303149d0fd49c8e83aba8ed6260324059efdcd992f629b23d13fc5d87b87","observation_id":"9a2440b7-8291-444f-a112-09c142415ee9","resolution":{"observed_at":"2026-05-15T20:20:17.298081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.00110","last_updated":"2026-04-23T12:54:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-18T14:58:18Z","title":"Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T21:22:41.935691Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.00110"},"observation_digest":"sha256:f186cd39f7681e48d8db90570efd2d3766470cbdbe7989b262725fb6220968ec","observation_id":"47cc75fc-f237-437a-b673-4da9cd804bdd","resolution":{"observed_at":"2026-05-15T21:30:20.975440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.01581","last_updated":"2026-04-27T12:47:49Z","snapshot_observed_at":"2026-07-06T22:47:33.195274Z","submitted_at":"2026-03-02T08:12:03Z","title":"KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T18:39:58.095112Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.01581"},"observation_digest":"sha256:c4eff339b5a373e733b1c2d3dda3c493853b1da51d24b905b42d14d85c061337","observation_id":"ac54e185-26f9-448e-932c-55ea746034b7","resolution":{"observed_at":"2026-05-15T18:40:14.593189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T19:35:38.385806Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.01766","last_updated":"2026-05-27T06:18:12Z","snapshot_observed_at":"2026-08-03T05:37:00.928605Z","submitted_at":"2026-03-02T11:48:24Z","title":"Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T19:35:38.385806Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.01766"},"observation_digest":"sha256:6c51fda1b35165f7251bc3798fec4ce2c737eab3298b130c2292c57964a68dad","observation_id":"9e779ea9-0eea-4086-b075-03cba721c6c7","resolution":{"observed_at":"2026-08-02T19:35:38.385806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.02115","last_updated":"2026-05-13T21:07:49Z","snapshot_observed_at":"2026-08-01T20:59:07.888539Z","submitted_at":"2026-03-02T17:38:58Z","title":"Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T17:59:52.365630Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.02115"},"observation_digest":"sha256:527ed2ce06363f15b0d86b8d1cbd0430af27956952453f8f101082d813de01d8","observation_id":"ab770e7a-bba9-4b6e-b0b4-0a257bf42ddf","resolution":{"observed_at":"2026-05-15T18:00:12.661658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.10126","last_updated":"2026-05-11T15:13:54Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T18:03:29Z","title":"AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T12:50:02.670780Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.10126"},"observation_digest":"sha256:e55f9a2f0bafb138af4a9e45e6db4e8c6909880b4ba4d9bb056495b19deaca1f","observation_id":"5b0b7430-c71b-4e2b-be27-aa5080bb5a42","resolution":{"observed_at":"2026-05-15T12:50:37.181369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.13966","last_updated":"2026-04-17T09:44:22Z","snapshot_observed_at":"2026-07-06T22:49:01.769027Z","submitted_at":"2026-03-14T14:38:53Z","title":"vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T11:24:45.578472Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.13966"},"observation_digest":"sha256:35b16cfde4e2e8f7249f1649a6dbe7fde0b5697d6049297daf269f6a184b108b","observation_id":"ff145d29-385c-4ae7-a8bb-486a5b596d7e","resolution":{"observed_at":"2026-05-15T11:25:30.903500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.14371","last_updated":"2026-05-18T10:25:25Z","snapshot_observed_at":"2026-08-02T15:59:44.938725Z","submitted_at":"2026-03-15T13:23:56Z","title":"OxyGen: Unified KV Cache Management for VLA Inference under Multi-Task Parallelism","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T11:46:12.134869Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.14371"},"observation_digest":"sha256:7fbadf77e03c5241d218fb4c605c166182690a20bd226adc0ea91adbfdb3f0af","observation_id":"80c3c169-1c8d-4e58-a86c-25698f7a17ba","resolution":{"observed_at":"2026-05-21T11:50:03.870101Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.15620","last_updated":"2026-06-30T14:22:00Z","snapshot_observed_at":"2026-08-05T18:05:02.204734Z","submitted_at":"2026-03-16T17:59:57Z","title":"Towards Generalizable Robotic Manipulation in Dynamic Environments","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T09:49:26.446868Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.15620"},"observation_digest":"sha256:ba1eee68495ccdddbc1871ecc156c32f6c1105d7ba1b2e16bf7f2407e233904b","observation_id":"dc73b356-41ad-4121-83b3-3aaaf8f56e93","resolution":{"observed_at":"2026-05-15T09:49:54.326780Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-14T00:13:51.580603Z","title":"arXiv preprint arXiv:2501.09747 (2025) 9, 11, 25, 26","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15620","last_updated":"2026-06-30T14:22:00Z","snapshot_observed_at":"2026-08-05T18:05:02.204734Z","submitted_at":"2026-03-16T17:59:57Z","title":"Towards Generalizable Robotic Manipulation in Dynamic Environments","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T00:13:51.580603Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.15620"},"observation_digest":"sha256:12d959d05276fb7b94ada57d0f5d0f79c13daa31472bd1a8b630cc835e81208d","observation_id":"a856bf57-2118-4f9b-98fb-4d89109fc848","resolution":{"observed_at":"2026-07-14T00:13:51.580603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.17573","last_updated":"2026-04-27T12:41:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-18T10:25:08Z","title":"HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:50.963123Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.17573"},"observation_digest":"sha256:c9c6c56031199b96f9d398a583a7d02502bdc9c14fdbbf0ad9e0197e44d98c5d","observation_id":"2cea80e3-bb25-4814-a574-cc457e8bee22","resolution":{"observed_at":"2026-05-15T09:19:54.404995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.17834","last_updated":"2026-04-26T06:47:15Z","snapshot_observed_at":"2026-07-06T22:49:33.482934Z","submitted_at":"2026-03-18T15:27:17Z","title":"Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T08:39:03.661087Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.17834"},"observation_digest":"sha256:dcf0edf3b9e16d1253ff34ab3401c87430a2d9a872d4ad8793b994bab8d180ec","observation_id":"f4d48a6c-510e-4923-9cfa-1be29594313c","resolution":{"observed_at":"2026-05-15T08:39:52.213026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-02T13:37:33.218495Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:13.188363Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:6ed9cef496ca6916daa5fef9591caf2827b47587bfae9c6bd37ce4173eb63c11","observation_id":"4dcfb5fd-2318-4d8f-8512-5ccfaf5b04fb","resolution":{"observed_at":"2026-05-15T08:05:15.181408Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-02T13:37:33.218495Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-21T10:48:56.280105Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:c4639050700afac8ed4ba221f37953ebde698583e769ed53ddf53c0ea0a17b20","observation_id":"2004ca27-2f34-428f-a72d-21042e7c79e6","resolution":{"observed_at":"2026-05-21T10:50:00.975469Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-13T18:17:45.786494Z","title":"Fast: Efficient action tokenization for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.25399","last_updated":"2026-06-30T11:28:34Z","snapshot_observed_at":"2026-07-13T18:17:43.965935Z","submitted_at":"2026-03-26T12:47:51Z","title":"LaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion Prior","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T18:17:45.786494Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.25399"},"observation_digest":"sha256:2ec34036964c9a6d0284f4d22c7cc49ae6188edf9632740821745ef9b03cf415","observation_id":"fc8b8e5b-b726-4976-9e72-b1e8451f21fd","resolution":{"observed_at":"2026-07-13T18:17:45.786494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.25661","last_updated":"2026-04-07T08:13:17Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T17:14:57Z","title":"Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T00:27:35.706107Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.25661"},"observation_digest":"sha256:681a3905d9093cf630e30fd64b72213549df88a73bb66505663ff3581accedc0","observation_id":"bccb7a51-0e66-4057-89eb-0d29352d9c81","resolution":{"observed_at":"2026-05-15T00:28:23.102611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.26320","last_updated":"2026-04-07T08:10:41Z","snapshot_observed_at":"2026-07-06T22:50:46.243903Z","submitted_at":"2026-03-27T11:38:43Z","title":"DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T22:59:21.473359Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.26320"},"observation_digest":"sha256:e316924495010ada902d7f0c742be2d7ac41b8f3e2d883d9b8648ee3fd35d344","observation_id":"51321e68-5091-4560-9106-27ef63b7aff6","resolution":{"observed_at":"2026-05-14T22:59:33.932755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2603.29844","last_updated":"2026-04-28T02:10:56Z","snapshot_observed_at":"2026-08-01T00:31:11.395521Z","submitted_at":"2026-03-31T15:02:27Z","title":"DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T23:21:13.658826Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2603.29844"},"observation_digest":"sha256:6f53532339adf07a2ee137fcd6d64ea8134ff8d746fab7eff202fd07a62081d3","observation_id":"e024f619-ddaa-41a3-a3c6-f57b528a210e","resolution":{"observed_at":"2026-05-13T23:23:26.310458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2604.03181","last_updated":"2026-04-03T16:57:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T16:57:06Z","title":"Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T18:54:07.081457Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2604.03181"},"observation_digest":"sha256:0fcef989ac33a7340b6e5736c2dd775c4341d7ae81544443b0c8b501437feece","observation_id":"bcbff7ca-3b7d-463a-9102-b1afe759f26b","resolution":{"observed_at":"2026-05-13T18:58:08.914108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2604.03191","last_updated":"2026-04-03T17:06:31Z","snapshot_observed_at":"2026-07-06T22:52:25.307426Z","submitted_at":"2026-04-03T17:06:31Z","title":"The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T18:49:07.376350Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2604.03191"},"observation_digest":"sha256:cecb15a0cde737cd3cb99dda47f9d16e5ca5b32692a113bf9a05dc6ef566af86","observation_id":"1226feed-329d-45ac-919c-5dd5640eb28d","resolution":{"observed_at":"2026-05-13T18:53:08.378413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2604.03208","last_updated":"2026-06-16T20:46:31Z","snapshot_observed_at":"2026-07-13T13:29:04.173053Z","submitted_at":"2026-04-03T17:32:36Z","title":"Hierarchical Planning with Latent World Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-13T20:13:58.991298Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2604.03208"},"observation_digest":"sha256:31932d3a818c3a968d559571596e189457ecf4ecf795062cc3ab569a6fc5ffda","observation_id":"6167e5e1-afb0-4904-8d8b-fe4b664ff974","resolution":{"observed_at":"2026-05-13T20:18:13.786304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2604.04161","last_updated":"2026-04-10T12:28:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-05T16:03:32Z","title":"Adaptive Action Chunking at Inference-time for Vision-Language-Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T16:57:52.595165Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2604.04161"},"observation_digest":"sha256:81f7a9f7af23b0b6f2ec5e0e841d09b6853de3e415a222046ae5073db5adaf19","observation_id":"68b4e89c-26f5-4668-8238-97e961dcdcac","resolution":{"observed_at":"2026-05-13T17:08:01.513460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2604.05072","last_updated":"2026-04-10T10:11:10Z","snapshot_observed_at":"2026-07-06T22:53:55.926521Z","submitted_at":"2026-04-06T18:18:47Z","title":"Hierarchical SVG Tokenization: Learning Compact Visual Programs for Scalable Vector Graphics Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:53:33.951884Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2604.05072"},"observation_digest":"sha256:46fc8f6fc1b10d030476c5809fa9c293a5ceea0d260cbfa563517cb7e7846c27","observation_id":"08970cd1-31fa-481d-b91e-e80f4dcba141","resolution":{"observed_at":"2026-05-11T08:52:32.433811Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2604.05323","last_updated":"2026-04-07T01:52:42Z","snapshot_observed_at":"2026-07-06T22:54:04.491386Z","submitted_at":"2026-04-07T01:52:42Z","title":"VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T18:33:26.708966Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2604.05323"},"observation_digest":"sha256:26ada1251b1051457971ea63c36b6a6e0c906734b945883125214eff99e2494d","observation_id":"349dd5ee-56fe-419a-b699-aa196cc02fc1","resolution":{"observed_at":"2026-05-11T08:52:32.433811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:9399424b7a551d0c15f0431d5a0b1bb2c6a9561fdf4063fb6a68388a258eee71","observation_id":"2136fea0-43eb-4595-9015-dac234295ab2","resolution":{"observed_at":"2026-05-11T08:52:32.433811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09747/citation-record","integrity":"/paper/2501.09747/integrity","json":"/paper/2501.09747/citation-record.json","paper":"/paper/2501.09747"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dis- crete cosine transform","venue":null,"work_id":"d0188da4-50a2-4b27-92e8-441b9590c285","year":1974},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:e13ee48f07dcabb622362b954f7df29a6dc27e5ed2aa4d9a3a6525ac8bd1ee43","observation_id":"bae3ca87-2444-40dc-b1c3-d16c9b308870","resolution":{"observed_at":"2026-05-11T08:52:32.405513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:42cb191c9054fbc55da442500ea2285b71673fa9ceeabaf1fbda4197e24d8dc2","observation_id":"e0d2a305-fe01-4fb1-88d8-8aa637f3478b","resolution":{"observed_at":"2026-05-11T08:52:31.959920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minivla: A better vla with a smaller footprint","venue":null,"work_id":"5feb606f-b7fc-495a-ae0e-89240411e3fd","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:27763c8180676356042c8a584ee8624d1654ca744e79dd94d473bc0664919664","observation_id":"2c402382-742d-4233-a846-ace70612bfdd","resolution":{"observed_at":"2026-05-11T08:52:32.386911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":"2403.01823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-07-10T14:37:16.092859Z","title":"RT-H: Action Hierarchies Using Language","venue":"cs.RO","work_id":"ecf7cf18-c1a8-4a6b-bc2a-fb165643aa0d","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:39b608d44b984908e590ebd2789fb3f3697ae4d033299082cbc0ab1cff8586f1","observation_id":"7c4b5521-4ff1-435b-bf32-e5ac0ff4fe6a","resolution":{"observed_at":"2026-05-17T06:53:27.953855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:cc62235b44d9d3f6aa6ea0813bfd3878322137d8adf1f92da0d1b081ec5695ab","observation_id":"bc76d6e0-6103-431e-84e1-79558827d5e8","resolution":{"observed_at":"2026-05-11T13:10:21.987351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roboagent: Generalization and efficiency in robot manip- ulation via semantic augmentations and action chunking","venue":null,"work_id":"4f788291-1da0-46e3-b5f9-9575c4a909ba","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:0b7cd81506e0431254bb184c88ae59848caf0cb6938f00588efaf11480ebd84b","observation_id":"4a6108e2-a318-4763-9cb0-824cf8f55913","resolution":{"observed_at":"2026-05-11T08:52:32.367864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:296b3ff6eece545905f6f3a8bf9d8a7c2c6ca24ca563de2981017e88be651181","observation_id":"0600c0bc-a69d-4080-8a38-1d103ef5b0e3","resolution":{"observed_at":"2026-05-11T08:52:31.885570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:89db29ba99e82651ccb99fe59bde86075cc36f68c6ab1c74c509fbe07538beaa","observation_id":"4ed60879-415d-45e0-b15b-cdbf7d349585","resolution":{"observed_at":"2026-05-11T08:52:31.895348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:4794a96fad2bff6af62e92322f4cb3ab9e8bb52e4adcc0ed4ea9cffef3d45524","observation_id":"e0b41df9-e0d6-4477-9494-b451fa7e1ab9","resolution":{"observed_at":"2026-05-11T08:52:31.904673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:07e0a046a6b83b1cee134311765b538774d2918d1b4e2cf56fc3b279490884db","observation_id":"fc482c4c-3273-44e8-85fd-cce4d26bac5b","resolution":{"observed_at":"2026-05-12T01:09:34.215368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-02T19:02:22.939940Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:6b6750632bb2ce9cccbf195ed66bb073ee664809c5c19a4ae05b7bc33b5bc3b4","observation_id":"0fd8edf6-6bcf-447c-a786-d6886f7d1814","resolution":{"observed_at":"2026-05-11T08:52:31.926052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:0c199c505a32886fc7cf673ea3bf5e74a4ea40896e27b9c357d3497f97e84abb","observation_id":"836504b2-6e5d-48a7-9dc3-fa941533a835","resolution":{"observed_at":"2026-05-11T08:52:31.934448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01512","last_updated":"2024-07-08T16:59:38Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:55:35Z","title":"Open-TeleVision: Teleoperation with Immersive Active Visual Feedback","version":2},"cited_work":{"arxiv_id":"2407.01512","doi":"10.48550/arxiv.2407.01512","metadata_source":"pith","pith_arxiv_id":"2407.01512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-television: Teleoperation with immersive active visual feedback","venue":"cs.RO","work_id":"4ca95dbb-b2bd-4e89-bb4f-6230e5b80db2","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2407.01512","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:8feb3a5889989979f630d7cdf2857ffda9557dbf77aca504b3bdba820be5c633","observation_id":"e63e21ac-9087-4699-806b-214448dc7f00","resolution":{"observed_at":"2026-05-11T08:52:31.940615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dif- fusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"628b6a26-955f-4400-958c-8187470d26f8","year":2023},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:fffe954738d3feadbd7da0c6be1f0e79634c00a7686801b3a1115f2694f66b47","observation_id":"e854caf7-f3ec-4203-b09a-61cc28501a40","resolution":{"observed_at":"2026-05-11T08:52:32.276352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal manipulation interface: In- the-wild robot teaching without in-the-wild robots","venue":null,"work_id":"e0e60fd5-6828-45c5-ab7f-90b16a77d163","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:2396981d8eefb19b45447b145997b9d810a6dd5b4b873b6b380890f2981d9aeb","observation_id":"b526abab-ecb1-49be-b41f-bd5255d464d2","resolution":{"observed_at":"2026-05-11T08:52:32.294575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An algorithm for the machine calculation of complex fourier series","venue":null,"work_id":"772f39e8-daab-4cb3-9803-60ab0308b57f","year":1965},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:7d28349ffea519dbd3c128056e05239bdfd018c6cdf30165d1b4a3abb570cbac","observation_id":"f542c32f-c3fa-4e53-993b-2248a17a4a93","resolution":{"observed_at":"2026-05-11T08:52:32.311544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Keypoint action tokens enable in-context imitation learning in robotics","venue":null,"work_id":"471ed9c7-0d34-4279-9471-6572269a6d7d","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:6d4c94742136ce3892afd432fbaf30b0e004347e04e18145c7794c9b5daa62e1","observation_id":"c62ca3ab-b25a-4109-9967-2a984199dc1f","resolution":{"observed_at":"2026-05-11T08:52:32.315767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling cross-embodied learning: One policy for manipulation, navigation, locomotion and aviation","venue":null,"work_id":"b6b57143-7e2d-4b8e-97ee-fbc1ac7702e3","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:8afe00b4999927bfeea43aab3b5bc9da890dfeb0e4820c05d214229d26f86380","observation_id":"2ce0f7c7-e664-495d-ad2e-176afc93a187","resolution":{"observed_at":"2026-05-11T08:52:32.319470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:e16e616f490bbd26ef6e33452b04def27d3cbf4fdb5b87bde23d515da514ef08","observation_id":"a54155e5-b5b8-4145-9dc9-ca23203faeab","resolution":{"observed_at":"2026-05-11T08:52:31.964936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tam- ing transformers for high-resolution image synthesis","venue":null,"work_id":"62275886-9b5b-474c-ad12-4fa28f336eca","year":2020},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:cdb491cf951fc0b45f449ddf9109eace149c72cc41d73fd06267ffe7c985cc37","observation_id":"e4f9e417-9a48-4503-bd8c-7f4dbf7b5d84","resolution":{"observed_at":"2026-05-11T08:52:32.330179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qi, Yin Zhou, Zoey Yang, Aur’elien Chouard, Pei Sun, Jiquan Ngiam, Vijay Vasudevan, Alexander McCauley, Jonathon Shlens, and Dragomir Anguelov","venue":null,"work_id":"bc8bda27-4840-49b1-814e-d80f68c47a19","year":2021},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:c72873ad46bfd509d4a6e6535aa6b13cde1635ee9921f2ff4a713c480f616591","observation_id":"d99d2fd7-e9c8-47e6-b7f8-9b1e24cab9ab","resolution":{"observed_at":"2026-05-11T08:52:32.333571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot","venue":null,"work_id":"77e8397b-0a71-483a-a642-52ff15ba79a8","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:753665d362c8caec4bfbb07718d411f903b1ff8d5b08d7ac0dbe224e1bea6ad3","observation_id":"0aee9769-5477-46f4-aeba-c69181368476","resolution":{"observed_at":"2026-05-11T08:52:32.337276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting","venue":null,"work_id":"b2023753-6f9c-43f6-b102-74bdc7786262","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:7ba7dcc9917b51a2d098a9833185e14346e023f5ed009c65278166125ff455b8","observation_id":"74ea73da-19d1-4b11-8546-fccdad4d667c","resolution":{"observed_at":"2026-05-11T08:52:32.346454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Humanplus: Humanoid shadowing and imitation from humans","venue":null,"work_id":"44a3c32a-9327-445e-ae33-2c18d46e332b","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:8af9c907926d4faf6e8d65ceb5fcba6cc768d2b0a5f127dad9b8472578438289","observation_id":"1de2e5bb-5534-4c44-add6-9afae8b7ec89","resolution":{"observed_at":"2026-05-11T08:52:32.350837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A new algorithm for data compression","venue":null,"work_id":"87db3f8a-1360-4dd3-bc65-1b56fa91b1de","year":1994},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:082b635e07ab76e251a595ee938d9b279a9cc3217f6162161eab5d58bad5982c","observation_id":"139b7318-649a-4636-997b-a44d25034a95","resolution":{"observed_at":"2026-05-11T08:52:32.355125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.00103","last_updated":"2016-04-02T16:26:23Z","snapshot_observed_at":"2026-07-06T04:38:17.613212Z","submitted_at":"2015-12-01T00:23:44Z","title":"Multilingual Language Processing From Bytes","version":2},"cited_work":{"arxiv_id":"1512.00103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1512.00103","snapshot_observed_at":"2026-07-04T20:56:20.888260Z","title":"Multilingual language processing from bytes","venue":null,"work_id":"8f113b15-ea50-445f-8904-93dc33a5b31b","year":2016},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/1512.00103","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:97445e2ce6ed5dc6b06e2c41f039acf3a2a41014c325ca8b3ae46a9f7b31cab4","observation_id":"9323ea76-cf37-4d3c-88f2-e2d062098c6d","resolution":{"observed_at":"2026-07-04T20:56:20.888260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:06:37.794172Z","title":"Singing voice graph modeling for singfake detection","venue":null,"work_id":"3c3dc12b-b160-46ce-956c-7d0499a00ba2","year":2019},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:9b0a5ade6a22915854dbcfb1a785ecf6e5e4f884b67449d921144c35e67e8853","observation_id":"1887f98b-1110-4843-aaf3-33a3be1c7998","resolution":{"observed_at":"2026-05-11T08:52:31.815851Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23289","last_updated":"2024-10-30T17:59:41Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:59:41Z","title":"Bridging the Human to Robot Dexterity Gap through Object-Oriented Rewards","version":1},"cited_work":{"arxiv_id":"2410.23289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging the human to robot dex- terity gap through object-oriented rewards","venue":null,"work_id":"4ca1d1d8-a258-49b6-ac99-ea5562e29ad5","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.23289","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:8c9897600161a92bbd4de1cd96204924b4c9a2af7d639fb5766a5fa662bf0d60","observation_id":"d374ff46-e885-4174-8c12-8a6ca347d6e5","resolution":{"observed_at":"2026-05-11T08:52:31.976627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UMI on legs: Making manipulation policies mo- bile with manipulation-centric whole-body controllers","venue":null,"work_id":"0be7997b-71f4-4b18-8efd-4781304f2c2f","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:ee37e0bcba456632ffc282e7f7290e602156938232d5104cc62f34b7785d021c","observation_id":"f3ff5b79-7cd0-47cf-b94b-fc97f1c58d63","resolution":{"observed_at":"2026-05-11T08:52:32.376947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2409.01652","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-07-04T16:39:58.441681Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","venue":"cs.RO","work_id":"c1f87e33-d716-44b5-ba00-98d693e65745","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:b5eda0e22636849d94f3515e91c44e042b22828b2649ce1ac56d0111efa4b990","observation_id":"1951f2e3-cbfb-4a6f-bd29-26b41b2ad0f8","resolution":{"observed_at":"2026-05-16T08:25:18.388921Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/jrproc.1952","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6f840223-839e-453c-a17a-fd85a857650b","year":1952},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:a1ff85ef24e7765201e2ee24e1d6fc7f7b53d3c5a33af8cfdedf680fbdcc22f6","observation_id":"930bdf6b-cfc2-4353-b922-9366a8ef917a","resolution":{"observed_at":"2026-05-11T08:52:31.831709Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14762","last_updated":"2025-04-03T02:29:28Z","snapshot_observed_at":"2026-07-06T19:54:13.876528Z","submitted_at":"2024-11-22T06:50:44Z","title":"Efficient Long Video Tokenization via Coordinate-based Patch Reconstruction","version":4},"cited_work":{"arxiv_id":"2411.14762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14762","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient long video tokenization via coordinated-based patch reconstruction","venue":null,"work_id":"2bc56a9d-5270-4eeb-9604-9eb7f5a72800","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2411.14762","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:b9f433c32e87e611c145a97a7b84f9b6a4222480637dad7e03e10727939861c4","observation_id":"70bc0a3e-e3ef-4560-86b2-de67a24c6e60","resolution":{"observed_at":"2026-05-11T08:52:31.993969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24185","last_updated":"2025-03-06T05:34:17Z","snapshot_observed_at":"2026-08-03T14:12:29.992356Z","submitted_at":"2024-10-31T17:48:45Z","title":"DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning","version":2},"cited_work":{"arxiv_id":"2410.24185","doi":"10.48550/arxiv.2410.24185","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.24185","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE International Conference on Robotics and Automation , pages =","venue":"arXiv (Cornell University)","work_id":"63e70973-5623-4c2b-8c0f-67005a2f1a93","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.24185","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:cb6fb03dac5e3f52c97240bb4cfac0fa1e222d27b75212a6325a811e3bc28408","observation_id":"ca0b98e2-7f33-4f5e-b31a-8f295255e97a","resolution":{"observed_at":"2026-05-11T08:52:32.000886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04693","last_updated":"2025-01-14T22:28:39Z","snapshot_observed_at":"2026-08-02T01:02:10.674272Z","submitted_at":"2025-01-08T18:57:33Z","title":"Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding","version":3},"cited_work":{"arxiv_id":"2501.04693","doi":"10.48550/arxiv.2501.04693","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond sight: Finetuning generalist robot policies with heterogeneous sensors via language grounding.arXiv preprint arXiv:2501.04693","venue":"arXiv (Cornell University)","work_id":"91689f9d-6958-4d44-89dd-127462e5bd0c","year":2025},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2501.04693","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:49a3bbab976a8bec95b83b4ca2ae095f6d74054e859d7a79b37c21a594071c08","observation_id":"17831756-63ec-4a95-9488-fbbc611cb21f","resolution":{"observed_at":"2026-05-11T08:52:32.008245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pris- matic vlms: Investigating the design space of visually- conditioned language models","venue":null,"work_id":"7aa0a147-5f3f-455d-b5c0-8df42f07ceef","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:ad38b68d9a852eb62883f8a0ec1f20fb9f3054300110484747089e4c90d17985","observation_id":"5d086ce1-2226-47e6-bb46-f50689720485","resolution":{"observed_at":"2026-05-11T08:52:32.412738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e44129bd-c4be-48e1-b1af-13c1225dc065","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:e912e83e2be2a0430eff23cb0edd75c5864cac85e86238bd29eb61f9c9472921","observation_id":"d11cc28c-9a22-44b3-b2f5-50a8e4853b89","resolution":{"observed_at":"2026-05-11T08:52:32.420266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:dbbe1d9cfe29058d382b5e66a094e5d6691ad1512f3cbb4d03af6db2634eeb42","observation_id":"88da5c10-2c5c-450b-adec-a4abfa1220ff","resolution":{"observed_at":"2026-05-11T08:52:32.015560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action chunking as conditional policy compression","venue":null,"work_id":"ce180d17-2fda-4aa8-af22-c897edab4050","year":null},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:1801ea425a16592094cd3d0dd7214a370a32de810927bc9d29addc2c15933b7c","observation_id":"01f6c475-9287-4e2a-950d-bbd4ac6a2fbe","resolution":{"observed_at":"2026-05-11T08:52:32.429969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03181","last_updated":"2024-06-28T04:15:33Z","snapshot_observed_at":"2026-08-04T18:59:25.456993Z","submitted_at":"2024-03-05T18:19:29Z","title":"Behavior Generation with Latent Actions","version":2},"cited_work":{"arxiv_id":"2403.03181","doi":"10.48550/arxiv.2403.03181","metadata_source":"pith","pith_arxiv_id":"2403.03181","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Behavior generation with latent actions","venue":"cs.LG","work_id":"859887e2-2079-408c-b000-3aad886b3387","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2403.03181","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:c137e43d28e2545c98a4de8961f297ffdb675c49379bccddc6e01cf91035d375","observation_id":"5603573c-d0d0-49bb-aada-44aa7a7651f6","resolution":{"observed_at":"2026-05-11T08:52:32.024830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16823","last_updated":"2024-05-22T22:44:28Z","snapshot_observed_at":"2026-07-06T18:05:42.862609Z","submitted_at":"2024-04-25T17:59:41Z","title":"Learning Visuotactile Skills with Two Multifingered Hands","version":2},"cited_work":{"arxiv_id":"2404.16823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16823","snapshot_observed_at":"2026-07-04T15:49:56.898978Z","title":"Learn- ing visuotactile skills with two multifingered hands","venue":null,"work_id":"f7dba6c3-e425-4afe-ae0f-70a0a285540b","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2404.16823","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:b422967af6f454c48890ccdb0f88a13caf5b9f0ec4a2c7cd9f3cbdb0fe85cf97","observation_id":"773e604a-216c-4d02-8af2-93adc7485486","resolution":{"observed_at":"2026-05-11T08:52:32.029968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":"ae463d76-202b-4d53-a04a-fa7b2c95b68d","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:b5e059763727d81eb4f268d5d70abc7059ff5d0316496a9940219372b47b199c","observation_id":"5d35112b-3e22-4330-a9ef-823018900679","resolution":{"observed_at":"2026-05-11T08:52:32.192350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"0116c04c-a4dd-4508-a120-64dd9a1b3f01","year":2023},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:02a603656b24454d0bc84c92c39b45e9f8bfd46ea8b5ca01d57b11da3ccf9031","observation_id":"f40da83b-c9a4-4e13-b4c3-1df1f3ac1ec0","resolution":{"observed_at":"2026-05-11T08:52:32.199076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:a6b850f7a132cb2b81afb5571ea8faab273b1ee3bcb6989cbf1759878e74c968","observation_id":"56bfbb44-3817-4bd2-ac75-64ef67e9f81a","resolution":{"observed_at":"2026-05-11T08:52:32.037835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Serl: A software suite for sample-efficient robotic reinforcement learning","venue":null,"work_id":"15d81870-15a0-426b-8339-2ac024988f3b","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:a0f93ab695888c19c4ec38b24282eeddb20cbf64463e091bbd452b03b7110841","observation_id":"98c3cb93-c186-4589-95dd-d5c95f24ccfc","resolution":{"observed_at":"2026-05-11T08:52:32.218349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roboturk: A crowdsourcing platform for robotic skill learning through imitation","venue":null,"work_id":"36f0db4b-6413-46b8-a439-173275e68107","year":null},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:56085907ce0843b21330ee55c95e51a1a14c00efbefe004066fb3765e05da231","observation_id":"87371680-dead-4f95-92a2-3784f2bcfecb","resolution":{"observed_at":"2026-05-11T08:52:32.237348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite scalar quantization: Vq- vae made simple","venue":null,"work_id":"622e9517-5e3e-49c6-baf0-c0657130c4c1","year":2023},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:d29c11383545eae3d094567e015439b5284a62a1c4a9120f806d886875038706","observation_id":"559e37a9-ac78-4c21-a367-b1a0e981aad3","resolution":{"observed_at":"2026-05-11T08:52:32.246351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15840","last_updated":"2024-09-11T13:02:48Z","snapshot_observed_at":"2026-08-05T14:58:55.657075Z","submitted_at":"2024-07-22T17:57:59Z","title":"QueST: Self-Supervised Skill Abstractions for Learning Continuous Control","version":3},"cited_work":{"arxiv_id":"2407.15840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quest: Self- supervised skill abstractions for learning continuous control","venue":null,"work_id":"8993d238-97af-451b-b546-dd3e2bf4f73f","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2407.15840","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:841e5df8226d5fd43dd2c1062fb484680307c7cb6328f61c3fbab4a74eee9096","observation_id":"ca6e0a4b-3e52-4a6f-aca0-5036622043c5","resolution":{"observed_at":"2026-05-11T08:52:32.044659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":"43ea940a-0632-4885-be6d-e38eddfd2eef","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:3e98f7936ef2dfba4d7d7fdb3fd2f44ec52085b4d7d91cbe54b5b32e58278226","observation_id":"c9591172-98da-4c6b-981a-ac2101d7d1e0","resolution":{"observed_at":"2026-05-11T08:52:32.268353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"a1c88e01-3793-4804-9d88-37ef09f87388","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:a0e01fb84df8ba217814ec34b7bc256474081b7ba6a22a7d5273bf4cc6f9711e","observation_id":"a516bdb4-14b9-47b2-86c5-abd31b7ec9f3","resolution":{"observed_at":"2026-05-11T08:52:32.326348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:74adc837e103839997215c3d7a9ae228d52678743f7b6b43084070c36cd8de85","observation_id":"36b4bd67-6172-4190-ad77-550a7bb25457","resolution":{"observed_at":"2026-05-11T17:23:25.503833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Byte latent transformer: Patches scale better than tokens","venue":null,"work_id":"356a8c80-9743-448f-82e2-bf39b40f9563","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:6f7c0104fd4f2f3875de76506d5cfa0dd1dbba36ba8a2cfb5798eee47b9b31ca","observation_id":"4a4e7967-2e5d-4712-818d-959e767d0ece","resolution":{"observed_at":"2026-05-11T08:52:32.373299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04887","last_updated":"2022-10-10T17:58:45Z","snapshot_observed_at":"2026-07-06T14:03:13.586644Z","submitted_at":"2022-10-10T17:58:45Z","title":"In-Hand Object Rotation via Rapid Motor Adaptation","version":1},"cited_work":{"arxiv_id":"2210.04887","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.04887","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In-Hand Object Rotation via Rapid Motor Adaptation, October 2022","venue":null,"work_id":"8c103b79-4402-4937-a0a8-8d47d32bcd0d","year":2022},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2210.04887","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:86d2a78cfa1f7ff93db00602f3b9b0eed24fdfe041cc845de6f280623fb751de","observation_id":"788e0cc3-a08a-4a69-b4d0-b08df8f32c1e","resolution":{"observed_at":"2026-05-11T08:52:32.060952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d32fd3de-b200-47e1-823f-c47e9019f299","year":2019},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:0d4c575abac8e6bc6de82c2655d5cef576b6ac05edd0fa0fc063d48d53b2673c","observation_id":"5ab9d296-bab5-404f-8188-319f34c3b3e7","resolution":{"observed_at":"2026-05-11T08:52:32.391035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A generalist agent","venue":null,"work_id":"a1c51123-3104-4a41-9770-44a153a38907","year":2022},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:3123d80d84bc74cae4e8968f4328a256b0b2a056062c7f61b6c446de3895b818","observation_id":"1f02c590-d58a-4d6e-84e0-6815ecfb47a5","resolution":{"observed_at":"2026-05-11T08:52:32.398230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":"1508.07909","doi":"10.48550/arxiv.1508.07909","metadata_source":"pith","pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Neural Machine Translation of Rare Words with Subword Units","venue":"cs.CL","work_id":"b540b77d-96cd-4550-9c11-d02686beb7b1","year":2015},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:532fad1323d378ce6277c2966010ab88f9bf7c5ec1e9e40131ccdeb26fddf894","observation_id":"30d41e1b-2759-45e0-acd8-0a23b752066e","resolution":{"observed_at":"2026-05-12T15:15:20.428834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08273","last_updated":"2024-09-12T17:59:07Z","snapshot_observed_at":"2026-07-06T19:14:33.669810Z","submitted_at":"2024-09-12T17:59:07Z","title":"Hand-Object Interaction Pretraining from Videos","version":1},"cited_work":{"arxiv_id":"2409.08273","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.08273","snapshot_observed_at":"2026-07-04T00:59:19.461553Z","title":"Hand-object interaction pretraining from videos","venue":null,"work_id":"d42723b2-e21c-4fcb-9bc5-daef208ee941","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2409.08273","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:9471a7c3ef2200f8de808917dc81b1cb2ae25827960d51641fb9fed8b2ae7d5c","observation_id":"5ce49807-3e8e-46a9-87c7-5ab79d51082a","resolution":{"observed_at":"2026-05-11T08:52:32.070856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T16:41:19.124504Z","title":"Neural discrete representation learning","venue":null,"work_id":"ed7372a6-9716-49ae-a27f-edc5710701dd","year":null},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:e43dda09249c8ac42a228dc9a9e58676e1d1928e7ebefa987d186c3e42d84281","observation_id":"136b9880-42d6-40fa-ac61-9d3b0c7f47a5","resolution":{"observed_at":"2026-05-11T08:52:32.180700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00937","last_updated":"2018-05-30T14:58:27Z","snapshot_observed_at":"2026-08-01T14:58:21.912263Z","submitted_at":"2017-11-02T21:14:44Z","title":"Neural Discrete Representation Learning","version":2},"cited_work":{"arxiv_id":"1711.00937","doi":"10.48550/arxiv.1711.00937","metadata_source":"pith","pith_arxiv_id":"1711.00937","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Discrete Representation Learning","venue":"cs.LG","work_id":"0148b1f3-8d2b-42bf-a801-174dc56f7597","year":2017},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/1711.00937","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:abcfb8959ff6ed979d8c9c72164939471b4f3630028219a6e1c853dec9f0e2a9","observation_id":"7ac2cf8b-b9e1-4fdb-81cd-fbd253706109","resolution":{"observed_at":"2026-05-11T08:52:32.079345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BridgeData v2: A dataset for robot learning at scale","venue":null,"work_id":"42b1f8e5-0fff-425a-b18d-8f9949c3979f","year":null},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:c20d16ec472f994010b0c4ad38f56e84499e7db2eddaea8905875d296908f4af","observation_id":"5d493849-b62b-42ef-9b98-f67b871fe005","resolution":{"observed_at":"2026-05-11T08:52:32.204338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The jpeg still picture compression standard","venue":null,"work_id":"018494b0-be30-45c4-a638-111a3455316a","year":1992},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:e4a0dc41c0edfc213d711d2439c7d686f51f0de813bbe0398067827ac953ce9e","observation_id":"62f4316b-b1af-4955-81aa-85293122d50e","resolution":{"observed_at":"2026-05-11T08:52:32.252985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling proprioceptive-visual learning with hetero- geneous pre-trained transformers","venue":null,"work_id":"eef0d332-1c16-4c34-afa4-11f3a2f8e953","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:bd783de2e02cd6146643c891b9877a61702164e7f5d5441f8ad497a2b44f005b","observation_id":"0ef39012-e3bb-40f7-88b8-b72e348e123f","resolution":{"observed_at":"2026-05-11T08:52:32.362588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":"2409.12514","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-07-04T04:29:35.761670Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"20b3dc32-113f-4f7b-8826-52a8d03fd6b3","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:ac58cff772a0e6b5794014faaccde311706df0dbdda5709265aed0875ec486ca","observation_id":"c5216e5f-b39a-4f44-83d4-f866473f92fc","resolution":{"observed_at":"2026-05-17T16:12:26.208161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08368","last_updated":"2025-02-02T19:28:27Z","snapshot_observed_at":"2026-07-06T19:31:31.809692Z","submitted_at":"2024-10-10T20:54:15Z","title":"ElasticTok: Adaptive Tokenization for Image and Video","version":2},"cited_work":{"arxiv_id":"2410.08368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.08368","snapshot_observed_at":"2026-07-03T20:28:55.525604Z","title":"Elastictok: Adaptive tokenization for image and video","venue":null,"work_id":"7155fb0c-5052-49e2-bba8-a680a3bbdd6b","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.08368","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:73eb2a6728f5200c1e78970670155b6e7d9070b3c18fa755ede0412961b8a37a","observation_id":"b1eb95a1-be23-421e-96f6-83b3bedfc13b","resolution":{"observed_at":"2026-05-11T08:52:32.096052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:a048582f8e7563cd0d42fc57b2381a95152ebc64518402a94f43cf92ad64b676","observation_id":"57cfbfcb-8c20-4ce7-95b9-c5e853cb1f70","resolution":{"observed_at":"2026-05-11T08:52:32.103559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05199","last_updated":"2023-04-05T02:32:59Z","snapshot_observed_at":"2026-07-06T14:28:56.301970Z","submitted_at":"2022-12-10T04:26:32Z","title":"MAGVIT: Masked Generative Video Transformer","version":2},"cited_work":{"arxiv_id":"2212.05199","doi":"10.48550/arxiv.2212.05199","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05199","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hauptmann, Ming- Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":"arXiv (Cornell University)","work_id":"051b6af9-904b-4679-af55-791d947f6233","year":2022},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2212.05199","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:2a216b3d5c12566f11aacd0178becb1b3cbd681e89c6473c6e16ed64857b2273","observation_id":"b8ac0df3-9642-4073-aa10-fa8153dde81c","resolution":{"observed_at":"2026-05-11T08:52:32.112802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":"5bd93071-4a22-477a-9296-4a6d6773c68c","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:e65e56b1dba2854fbd934848929956b30d1346b140fb4da6155971528e9cf526","observation_id":"4f83859b-9f94-42aa-8527-aa8ca9156103","resolution":{"observed_at":"2026-05-11T08:52:32.424610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03312","last_updated":"2021-07-07T15:45:42Z","snapshot_observed_at":"2026-08-04T20:20:32.398006Z","submitted_at":"2021-07-07T15:45:42Z","title":"SoundStream: An End-to-End Neural Audio Codec","version":1},"cited_work":{"arxiv_id":"2107.03312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.03312","snapshot_observed_at":"2026-07-04T08:29:41.902212Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":"e2f34c6d-cf73-4f48-a80a-732b812cc299","year":2021},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2107.03312","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:03e804a5300da8dc31ac12331b1d07ef47105ad3e194f187e4567a1b6aeefe61","observation_id":"79955a72-0acc-47f7-a02a-8a740e4e8185","resolution":{"observed_at":"2026-05-11T08:52:32.118854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:511bbc61e2413113242a73761c2a7b394197fbec593ebdc5db007fb9d4c8e5cc","observation_id":"c6a7f4cc-755b-43a4-b328-2f3589bc4b7f","resolution":{"observed_at":"2026-05-11T08:52:32.132745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13126","last_updated":"2024-10-17T01:29:49Z","snapshot_observed_at":"2026-08-05T13:44:48.719708Z","submitted_at":"2024-10-17T01:29:49Z","title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","version":1},"cited_work":{"arxiv_id":"2410.13126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13126","snapshot_observed_at":"2026-07-04T19:30:08.155799Z","title":"Aloha unleashed: A simple recipe for robot dexterity","venue":null,"work_id":"db13f99b-32b7-4745-adc2-d4cfb5799638","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.13126","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:94306753e4635169d05404a4aa167def7d1717ed654b177d09e72a3df2835baa","observation_id":"c58671ea-6b25-4182-a6a0-aada05b60156","resolution":{"observed_at":"2026-05-11T08:52:32.146345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:eeb050ac054b4ecd3b2336bd147d211e4f4d4a4bdc029218c7e2dc347f71ab10","observation_id":"74032957-6ba3-4cf5-b1ba-8fb2cc4d88bd","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":"2412.10345","doi":"10.48550/arxiv.2412.10345","metadata_source":"pith","pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","venue":"cs.RO","work_id":"56a1dd5b-7094-408b-8742-b80a424a62bb","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:212538de0d9e692a326d8ffa07bd82ff6f57a6e1f826ddba6b81d3a3fa3b5bd3","observation_id":"1b72a23b-1c38-46e7-b57a-0998e8f618de","resolution":{"observed_at":"2026-05-15T18:27:23.210785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autonomous im- provement of instruction following skills via foundation models","venue":null,"work_id":"9f7af3ec-a5d5-4793-9c14-3318dd9f45ee","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:1d295e682a349871789c455ef1a1f0b02387348a099f2b735009f5b50a01f426","observation_id":"6e150253-6d71-4ff0-ba0b-2ab9035b8ed9","resolution":{"observed_at":"2026-05-11T08:52:32.381099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compression of individ- ual sequences via variable-rate coding","venue":null,"work_id":"ba5d5cf0-13a3-446d-bef1-f7a7f908e035","year":1978},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:73f11a97840b986498d45d6920e793f8ab521010af6e58fc5a396d2890e97172","observation_id":"b6d45ae7-00c2-46b6-840f-b972d00b3a48","resolution":{"observed_at":"2026-05-11T08:52:32.185722Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":2,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":34,"verified_fuzzy":33},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 100 inbound Pith citation observations for arXiv:2501.09747."}