{"as_of":"2026-08-07T17:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e313be6e955d08aa37584c51e210b4f2df2c08f2196f3235e0c70637609d05e","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:07:26.130586Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:59:53.042021Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:19:43.485742Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-08-03T20:59:53.042021Z","title":"VQ-VLA: Improving vision-language- action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:53.042021Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2511.17502"},"observation_digest":"sha256:7e6ab62e293d1a457ab624dd587cf96f044bce8206dea49fe7b3c777643d6729","observation_id":"3a81d664-dbb7-49fc-8697-3ce1f15be229","resolution":{"observed_at":"2026-08-03T20:59:53.042021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2511.18085","last_updated":"2026-05-08T04:30:23Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T15:00:08Z","title":"Continually Evolving Skill Knowledge in Vision Language Action Model","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T06:02:31.638120Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2511.18085"},"observation_digest":"sha256:00139d18f64fab766782f84e52df142bd1fb41b2bcb1105c7b57f29d5ab52aaa","observation_id":"4f2fbe16-6b13-4c90-9544-c2ded5458320","resolution":{"observed_at":"2026-05-17T06:04:09.248500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-08-03T13:29:48.923259Z","title":"Vq- vla: Improving vision-language-action models via scaling vector- quantized action tokenizers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-06T23:32:01.648397Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:48.923259Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:44309b873d3ab1fe2bf9ee468e00b331fb6999a6ca49510532d5f28811660fc6","observation_id":"5a469e98-446a-4ff9-8737-5725a9922559","resolution":{"observed_at":"2026-08-03T13:29:48.923259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2602.12978","last_updated":"2026-05-17T13:09:20Z","snapshot_observed_at":"2026-08-05T03:16:35.662407Z","submitted_at":"2026-02-13T14:56:06Z","title":"Learning Native Continuation for Action Chunking Flow Policies","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T12:38:26.522838Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2602.12978"},"observation_digest":"sha256:53d8e73d32fa209bbea0f62b8c0c526e92cd4e0ba7459b61416a536451de2afa","observation_id":"d3391853-c917-4460-8253-b556712ed4f2","resolution":{"observed_at":"2026-05-21T12:40:08.704943Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T13:04:30.544504Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:b1e43b498b568d33cb8b8bbfa6fece20a02270984646503946693b96af8b3e2a","observation_id":"2b267576-52e1-4a81-b10e-890416b67a99","resolution":{"observed_at":"2026-05-21T13:05:10.051106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-08-02T21:37:14.978308Z","title":"Vq-vla: Improving vision- language-action models via scaling vector-quantized ac- tion tokenizers.arXiv preprint arXiv:2507.01016, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:14.978308Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:ff52545cdd1adb531fe019876af1441b71a8122fd37a66105254785185a2bc55","observation_id":"408a266b-fe64-4d6d-a97c-0ced98d15a1f","resolution":{"observed_at":"2026-08-02T21:37:14.978308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T03:57:10.338617Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:750378debed7995bba4b9f6cd6dae9c1c1abfbf3e3ef1f0fbca43572c480ab68","observation_id":"97714748-41f3-43a9-b146-f3ad49458b1d","resolution":{"observed_at":"2026-05-13T03:57:12.827282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-30T22:11:21.596611Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2605.12369"},"observation_digest":"sha256:e3590eceee7e07410210742991ffb36b8427f0aef5fe96d19f4da73b40748ba8","observation_id":"6a8e3e34-85de-437e-998b-533c131989ae","resolution":{"observed_at":"2026-07-01T14:15:46.671785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T06:05:52.461348Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:26618480f7edbea8ecdb8be8e60f0bb3ea06c62d6271ff1c85e3ac89280cd59a","observation_id":"eb409383-3e7e-4ba8-9645-4bef12279702","resolution":{"observed_at":"2026-05-22T06:06:08.666110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2605.22671","last_updated":"2026-05-31T08:30:46Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:19Z","title":"From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T16:52:05.565650Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2605.22671"},"observation_digest":"sha256:d9ebe218a1cf81d0f43f93e54148105fe957076f67ff7b1c216268b470f35a56","observation_id":"d7a5fd1e-bd22-4e94-bdcd-8398898ae269","resolution":{"observed_at":"2026-06-30T16:54:58.265667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2606.21372","last_updated":"2026-06-19T12:24:49Z","snapshot_observed_at":"2026-08-01T15:59:11.712537Z","submitted_at":"2026-06-19T12:24:49Z","title":"NAC: Neural Action Codec for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T13:59:53.484305Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2606.21372"},"observation_digest":"sha256:5331a47efac5e7864f7cfc87066e78d9281b48215d33b603b0315e0108c9f4fb","observation_id":"3df18ac4-53bf-401e-94a0-bec8be992c4c","resolution":{"observed_at":"2026-07-04T06:59:37.911642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":"2507.01016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-04T09:19:43.485742Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016","venue":null,"work_id":"2d49f961-abca-44e9-9f82-01c68a8e158b","year":2025},"citing_paper":{"arxiv_id":"2606.22480","last_updated":"2026-06-21T12:49:46Z","snapshot_observed_at":"2026-07-06T23:57:18.596834Z","submitted_at":"2026-06-21T12:49:46Z","title":"ARP: Enhancing Quantized Skill Abstractions via Visual Alignment and Iterative Refinement for Robotic Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T10:14:42.111428Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2606.22480"},"observation_digest":"sha256:49799152afc299d4fe657131929b9ee346c4593af0a931ec57708845cbe933f1","observation_id":"29b1bc9b-80ac-436d-a26e-b6ec5eceff9d","resolution":{"observed_at":"2026-07-04T09:19:43.487289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-07-14T05:40:47.306935Z","title":"Vq-vla: Improving vision- language-action models via scaling vector-quantized ac- tion tokenizers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11427","last_updated":"2026-07-13T11:31:53Z","snapshot_observed_at":"2026-08-07T09:19:25.836681Z","submitted_at":"2026-07-13T11:31:53Z","title":"EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T05:40:47.306935Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2607.11427"},"observation_digest":"sha256:776a0873c9528be5a1b60cab2cf847d36da4e98fc68595ea46e9bef59042dd8c","observation_id":"64cce292-40e0-4212-8839-749231c2e2d0","resolution":{"observed_at":"2026-07-14T05:40:47.306935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01016","snapshot_observed_at":"2026-08-02T05:01:26.608329Z","title":"Vq-vla: Improving vision-language-action models via scaling vector-quantized action tokenizers.arXiv preprint arXiv:2507.01016, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13522","last_updated":"2026-07-15T07:21:00Z","snapshot_observed_at":"2026-08-06T09:52:56.632546Z","submitted_at":"2026-07-15T07:21:00Z","title":"Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:01:26.608329Z"},"links":{"cited_paper":"/paper/2507.01016","citing_paper":"/paper/2607.13522"},"observation_digest":"sha256:50955fa45a49ff2522ab0a8b74351f667b2c2717e2866499eedfce1bc79f44ee","observation_id":"f734bcda-218e-4a07-8473-f5a4d39067db","resolution":{"observed_at":"2026-08-02T05:01:26.608329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01016/citation-record","integrity":"/paper/2507.01016/integrity","json":"/paper/2507.01016/citation-record.json","paper":"/paper/2507.01016"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:07:22.122914Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.122914Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:fb53a6f9d7a26299ace7c2cfc0258532996c1c2740304f6a9a2f451062b8cc29","observation_id":"0bb710e7-e1dd-4a4a-9df3-36d5f420dc2e","resolution":{"observed_at":"2026-08-06T21:07:22.122914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-06T21:07:22.189706Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.189706Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:bbcc676ab1b3a67c18ef5f49bb35a072087cca0bf43cf298d70a560d2dc59ea9","observation_id":"d2b560d4-2189-4451-aa56-58d7370ba347","resolution":{"observed_at":"2026-08-06T21:07:22.189706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:28.375397Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":"3f16cad1-be8f-4952-ae2b-2354cb40c83f","year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.275615Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:0ce1f1fbefd38588470cf63f92ff65dcd753d8ca551d74cb501a4c02089c121e","observation_id":"8cb96dad-3e34-4e3b-be2a-3df86d9bd178","resolution":{"observed_at":"2026-08-06T21:07:28.458950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:28.237652Z","title":"Minivla: A better vla with a smaller footprint","venue":null,"work_id":"4b72b573-969e-4a47-ae95-1549b0565ff2","year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.363654Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:345591caa6e588ceb0f2ce4fa515b68f09b515324a94fff878d38f6b5347ca1e","observation_id":"bab2aed8-d8df-48d5-b6d8-f8f3ca6e8650","resolution":{"observed_at":"2026-08-06T21:07:28.333788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T21:07:22.451956Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.451956Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:7870b5affa10fb640d1e53a2a8bdadd8e5fb29ca99148b49bd9bcfd977e37bab","observation_id":"9b752740-a23b-42b6-a8c4-1e9ce8e0b41b","resolution":{"observed_at":"2026-08-06T21:07:22.451956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T21:07:22.506991Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.506991Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:05b88c908b85cad3706cc7fe70cf3d939fa47a1960c14b26a6a7e056c5ab3a20","observation_id":"6df64edd-df2d-43d0-b50b-7a9991989922","resolution":{"observed_at":"2026-08-06T21:07:22.506991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-06T21:07:22.569402Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.569402Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:0e50f5f66a0eda8d2d2a21ba6f47345e8a6de37653bfa55523cab18d32e16129","observation_id":"d43c688d-cb8a-4c24-815a-9141f9a3bea3","resolution":{"observed_at":"2026-08-06T21:07:22.569402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:28.104015Z","title":"Anyvlm: Unified vision-language model for any robot morphology","venue":null,"work_id":"fc429e7c-0c84-44e4-93da-8bb9b4484225","year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.651487Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:21030e6470a211ef280581dec350d6533a8615e3eb0966705b554ad7ef09500d","observation_id":"3a2658ac-b097-4a57-99f2-2d45dbf88426","resolution":{"observed_at":"2026-08-06T21:07:28.147454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-06T21:07:22.706473Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.706473Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:ed19529b83ed48b6853f8699c4c50a218fdbec3ae036e8d73bc0f5e1914e9430","observation_id":"d4f6ece7-02f1-4998-ac13-45b3652590c6","resolution":{"observed_at":"2026-08-06T21:07:22.706473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-08-06T21:07:22.759775Z","title":"Igor: Image-goal representations are the atomic control units for foundation models in embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.759775Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:af7d2ec0fc6f97b7f5ad33712e808b2f4f94081f387c8d2d62d68e6505b58b51","observation_id":"3827fc8f-d211-4da5-b32d-9e48b3d2b97c","resolution":{"observed_at":"2026-08-06T21:07:22.759775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.966497Z","title":"Diffusion policy: Visuomotor policy learning via action diffu- sion","venue":null,"work_id":"0eee8994-17fd-4577-9974-6a37b2d6ddda","year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.864369Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:293deeef471d5e3b14153d2f011cb3f3e966159a23c38e7545c340f91ca688cf","observation_id":"7457aed0-8bc8-4c67-8070-4a723c9fbbd1","resolution":{"observed_at":"2026-08-06T21:07:28.002060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19578","last_updated":"2024-10-17T19:31:39Z","snapshot_observed_at":"2026-07-06T17:52:38.371963Z","submitted_at":"2024-03-28T17:04:00Z","title":"Keypoint Action Tokens Enable In-Context Imitation Learning in Robotics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19578","snapshot_observed_at":"2026-08-06T21:07:22.903469Z","title":"Keypoint action to- kens enable in-context imitation learning in robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.903469Z"},"links":{"cited_paper":"/paper/2403.19578","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:658080db7d08cc1e357b1832c4ba1deee84e1af4e286866ed5079f75f256842c","observation_id":"49ca3dd1-337e-4860-8823-47335f20c2c8","resolution":{"observed_at":"2026-08-06T21:07:22.903469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.867882Z","title":"Palm-e: an embod- ied multimodal language model","venue":null,"work_id":"4b629c15-d27d-4829-882a-e8690e541123","year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:22.959736Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:a979e6f0644cd8e43e849afe4d9c568fca99e234f8d9c66b658d0c0dac8cf5ad","observation_id":"f6a7de39-98df-4cdc-836c-6243442d69a2","resolution":{"observed_at":"2026-08-06T21:07:27.918616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.777147Z","title":"Exploiting llm quantization","venue":null,"work_id":"c5bebd73-82c2-4948-b3b2-c60c65b8bd0c","year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.014734Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:4201ea56f36c0afb5f6b2d7238292c249f77429f79b60113af2a10d6b4a8ff5d","observation_id":"97837d45-4a19-4c9f-a7d8-8072d999b00b","resolution":{"observed_at":"2026-08-06T21:07:27.833382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.679623Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"d3146187-8d81-4084-afd6-cd2e31b5dca6","year":2021},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.128367Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:442e75e5741997d8fedb97107d5f60014ced6517c7293663cbcb11a00d3880eb","observation_id":"f2dbaa8c-661a-4e26-ba7c-87affb1f7875","resolution":{"observed_at":"2026-08-06T21:07:27.731198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00595","last_updated":"2023-09-26T10:47:35Z","snapshot_observed_at":"2026-07-06T15:49:23.374270Z","submitted_at":"2023-07-02T15:33:31Z","title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00595","snapshot_observed_at":"2026-08-06T21:07:23.240619Z","title":"Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.240619Z"},"links":{"cited_paper":"/paper/2307.00595","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:ae593efd16895e8471f8c4620f142e13be5309c89467068a96d251af65fd075a","observation_id":"c5c4ba28-880a-40a5-b658-21c9594fb4d5","resolution":{"observed_at":"2026-08-06T21:07:23.240619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.590862Z","title":"A new algorithm for data compression","venue":null,"work_id":"3a786577-0199-4bdc-83d4-264828783b5f","year":1994},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.348202Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:04be3b10c2b47c46a01dc292e4d34f7a7186c81b35c11f08ee80b6094c15595e","observation_id":"96be1bc3-b35f-431b-b1a5-c6304326c03f","resolution":{"observed_at":"2026-08-06T21:07:27.620501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.481214Z","title":"Act3d: 3d feature field transformers for multi-task robotic manipulation","venue":null,"work_id":"69530bea-0aa1-42a6-a0e7-24db2456b508","year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.457029Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:9f2a31d8364c48cf3c452cf0940e1175f788585430074d6ca41ba37ed26f5b57","observation_id":"743aa2af-c4ba-4d72-96f2-2b3cd9565335","resolution":{"observed_at":"2026-08-06T21:07:27.531754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-07T14:52:56.563730Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-06T21:07:23.545915Z","title":"Relay policy learning: Solving long- horizon tasks via imitation and reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.545915Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:6a185e5d0498ad3f7d3c4bce7a736b53db3886196b94d1fb06de4ccd5857e64a","observation_id":"85db7f8c-2df1-49c7-836d-3b681e7bcffb","resolution":{"observed_at":"2026-08-06T21:07:23.545915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.04143","last_updated":"2024-05-03T15:00:50Z","snapshot_observed_at":"2026-08-06T01:36:48.822991Z","submitted_at":"2015-11-13T02:34:33Z","title":"Deep Reinforcement Learning in Parameterized Action Space","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.04143","snapshot_observed_at":"2026-08-06T21:07:23.686753Z","title":"Deep reinforce- ment learning in parameterized action space","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.686753Z"},"links":{"cited_paper":"/paper/1511.04143","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:265695e3d06c8dad3b230132ea6c79a29eccf796a323a18e46ccaed785c4cc24","observation_id":"b1115345-e57e-4ec5-a187-8b9c1ed1f47e","resolution":{"observed_at":"2026-08-06T21:07:23.686753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-06T21:07:23.792753Z","title":"Cogvideo: Large-scale pretraining for text-to-video gen- eration via transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.792753Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:f1f343399357087f9679982c22a9bc4c60ffb2b41d9d47ca8ae02ceb83e48e80","observation_id":"8e9902a1-93fd-498e-b383-c9e4935b72b7","resolution":{"observed_at":"2026-08-06T21:07:23.792753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.384715Z","title":"Rlbench: The robot learning benchmark & learning environment","venue":null,"work_id":"725b12ac-51de-4f56-9913-32b68b06af3a","year":2020},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.874297Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:922a6f8c2a03999334a9cab03fb9401a338839c47e7658a20e3737794b7ea272","observation_id":"13dca03f-3454-44ce-8b2e-858468f84538","resolution":{"observed_at":"2026-08-06T21:07:27.442533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:23.982056Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:23.982056Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:3ccc99471bfd491923a3f30a3c2ec4d9abcc58c26763afd86554f2ba0f6540f9","observation_id":"398ef956-5728-4acf-aeae-20f2aa4fcf33","resolution":{"observed_at":"2026-08-06T21:07:23.982056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T21:07:24.072732Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.072732Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:3f06302217635c6044625075dff449a3d34f84e31c82b6a3419fe649c7490ea7","observation_id":"60582574-bb70-4fc5-abd2-93782b851e18","resolution":{"observed_at":"2026-08-06T21:07:24.072732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-06T21:07:24.169056Z","title":"Fine-tuning vision-language-action models: Optimizing speed and suc- cess","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.169056Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:06537872c6a196b63054f35fbf00f7aa11dc11c064caefb79cf0cda25ca8d70a","observation_id":"aa408865-f62b-4e67-8fa0-68500444dcf2","resolution":{"observed_at":"2026-08-06T21:07:24.169056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03181","last_updated":"2024-06-28T04:15:33Z","snapshot_observed_at":"2026-08-04T18:59:25.456993Z","submitted_at":"2024-03-05T18:19:29Z","title":"Behavior Generation with Latent Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03181","snapshot_observed_at":"2026-08-06T21:07:24.226708Z","title":"Be- havior generation with latent actions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.226708Z"},"links":{"cited_paper":"/paper/2403.03181","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:34b610f42317bb4c6524ad17ce2da22b85ee33ab9ea6e4552b390c98f33ff495","observation_id":"ab9bdf39-151d-42fc-93a5-b7188949b3f1","resolution":{"observed_at":"2026-08-06T21:07:24.226708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-06T21:07:24.295662Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.295662Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:1376a225533905c111b7b67c5572f36f69f463d6cfb5f4f95053f9ec294ba0a1","observation_id":"12ce03b6-eb68-4fdd-b832-d35b9d18ff2f","resolution":{"observed_at":"2026-08-06T21:07:24.295662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-06T03:43:29.067278Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-06T21:07:24.365470Z","title":"Open-magvit2: An open-source project toward democratizing auto-regressive visual generation.arXiv preprint arXiv:2409.04410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.365470Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:6cba6d3b529e7542e7869bde90290cb01ab18502a725de8b98a09aa28c30cd43","observation_id":"ff2f85e6-844b-4225-8780-158474d501a5","resolution":{"observed_at":"2026-08-06T21:07:24.365470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T21:07:24.445625Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.445625Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:17a6cf09dc0b3d0fb68eecdfb5fce076abbf88ccb9ee160f906fca53ee22e7d9","observation_id":"c61f6e63-fbab-4d01-a09e-f871f4665d8d","resolution":{"observed_at":"2026-08-06T21:07:24.445625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.272758Z","title":"Quest: Self-supervised skill abstractions for learning continuous control","venue":null,"work_id":"dbcfea23-b3ce-469a-b497-05d4f1180f70","year":2025},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.514228Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:75ee3d035174115b6642c8165de12364819193821a65a50c34ec13b4882aba70","observation_id":"2dc1c629-12aa-4ffc-b9c5-24dd9705b76a","resolution":{"observed_at":"2026-08-06T21:07:27.322251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-07-06T11:34:01.629249Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-08-06T21:07:24.596296Z","title":"Maniskill: Generalizable manipulation skill benchmark with large-scale demonstrations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.596296Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:163a17af9fcb2f839f6e16aefeae87efb68159159d161d252b0b922b1b680646","observation_id":"5beecf7a-5133-43f5-a2de-2873d75a10cf","resolution":{"observed_at":"2026-08-06T21:07:24.596296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.177208Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"f161c173-296d-4533-b230-87977d6bdcc6","year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.653961Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:df6e4b031a09994959042d4990ef5cbb1dc477660b4f1bc0b1d9cb78b6ed7551","observation_id":"2b13a5cb-123d-45f7-a071-a5d63ffe1527","resolution":{"observed_at":"2026-08-06T21:07:27.226869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-06T21:07:24.690665Z","title":"Fast: Efficient action tokenization for vision- language-action models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.690665Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:88807610f22b15507836db9f0f2b1fc2c2c7fb5004f99ecc5858883f8d38dd11","observation_id":"0c87a25f-e31b-4a1c-bcc9-b8cbf4155947","resolution":{"observed_at":"2026-08-06T21:07:24.690665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:27.085503Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":"4c5b3f32-8e9f-451a-adfa-c3884c85b63a","year":2019},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.774942Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:c60cc509cf15a8d5f017a079c7442377b992327f073fce40a5d19eac390760b0","observation_id":"49f8508b-3bab-41b6-9b32-6d4ba7b90ecb","resolution":{"observed_at":"2026-08-06T21:07:27.133600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02692","last_updated":"2025-03-10T09:01:48Z","snapshot_observed_at":"2026-07-06T20:01:05.921085Z","submitted_at":"2024-12-03T18:59:10Z","title":"Scalable Image Tokenization with Index Backpropagation Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02692","snapshot_observed_at":"2026-08-06T21:07:24.825964Z","title":"Taming scalable visual tok- enizer for autoregressive image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.825964Z"},"links":{"cited_paper":"/paper/2412.02692","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:7a6c2c8147526c1ddb29bd082b801ece0782fc7bb0a6bb3c5c5f8c93d2cf4b62","observation_id":"3a536382-8929-4bb4-a7a0-e36e558a26ef","resolution":{"observed_at":"2026-08-06T21:07:24.825964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11796","last_updated":"2024-12-09T18:31:01Z","snapshot_observed_at":"2026-08-07T10:56:20.468878Z","submitted_at":"2024-08-21T17:38:48Z","title":"LLM Pruning and Distillation in Practice: The Minitron Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11796","snapshot_observed_at":"2026-08-06T21:07:24.915904Z","title":"Llm pruning and distillation in practice: The minitron approach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.915904Z"},"links":{"cited_paper":"/paper/2408.11796","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:b86d8539b1bf914ac8fca3ee375e475559fe5858c68a2389026c87bf2cc95c4c","observation_id":"7366d8dd-f706-4cfe-b1e1-b8382b733708","resolution":{"observed_at":"2026-08-06T21:07:24.915904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T21:07:24.973912Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:24.973912Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:ca883ec8ee897e40d945ec31b27b2ae439e015f42697cde26bbd574a1e17327b","observation_id":"4db8a6af-59f3-4159-a494-9b86e285c1fe","resolution":{"observed_at":"2026-08-06T21:07:24.973912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T21:07:25.030945Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.030945Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:bcdc020ea265fd602c855654b94fec03f7f77c2f686995050930bab18d8be5be","observation_id":"8554926e-dcd0-4b2a-93ab-00b3c145a3de","resolution":{"observed_at":"2026-08-06T21:07:25.030945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:25.105749Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.105749Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:0483091658e53f4686ae3c610d96bda6a779325d4e3a04a6a41ae4e8804fd618","observation_id":"d9d6a6d4-90fa-462c-9991-fda81792a0fb","resolution":{"observed_at":"2026-08-06T21:07:25.105749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:26.980594Z","title":"Chatgpt for robotics: Design principles and model abilities","venue":null,"work_id":"06bb5c32-992c-4514-b3c6-b780b92c97ec","year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.151700Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:3400c3877c38d80b753e7b01eb2806bec960b83731c1aa9fb27b399943faaf16","observation_id":"9c69885d-71c4-4ad6-b823-a8a55f78fdc6","resolution":{"observed_at":"2026-08-06T21:07:27.044323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-06T21:07:25.244285Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.244285Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:02c7afe296f810b95edf6d9d6fa1560809a0876061b3673b8fae66ba320832d8","observation_id":"bd82c91d-c9d7-45fc-a6a3-c4788a484fdb","resolution":{"observed_at":"2026-08-06T21:07:25.244285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-06T21:07:25.323052Z","title":"Tinyvla: Towards fast, data-efficient vision- language-action models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.323052Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:146943ecbb5e6fa6cdc50e0aead7a9a1e505aacbc6e53186492b2d4c1d99454e","observation_id":"fd872960-f77d-4bab-9005-d9e24eec506c","resolution":{"observed_at":"2026-08-06T21:07:25.323052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05716","last_updated":"2025-02-07T14:58:32Z","snapshot_observed_at":"2026-07-06T15:40:39.214427Z","submitted_at":"2023-06-09T07:22:12Z","title":"Transferring Foundation Models for Generalizable Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05716","snapshot_observed_at":"2026-08-06T21:07:25.362504Z","title":"Transferring foundation models for generalizable robotic ma- nipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.362504Z"},"links":{"cited_paper":"/paper/2306.05716","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:115023de09ef8969bac1fefa94e37a5cf56bf58765f28213b1f3db48e08b7581","observation_id":"748b3e90-2048-49ad-a580-f499ac889134","resolution":{"observed_at":"2026-08-06T21:07:25.362504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05304","last_updated":"2024-11-21T17:45:43Z","snapshot_observed_at":"2026-07-06T17:41:34.856417Z","submitted_at":"2024-03-08T13:33:00Z","title":"Spatiotemporal Predictive Pre-training for Robotic Motor Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05304","snapshot_observed_at":"2026-08-06T21:07:25.446793Z","title":"Spatiotemporal predictive pre-training for robotic motor control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.446793Z"},"links":{"cited_paper":"/paper/2403.05304","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:bf352ee3aceba5955f5e548f62baeedae04b925db71605f3ba707312ceb4ef95","observation_id":"da1bc365-02d9-4d08-a4b0-9b76864969d4","resolution":{"observed_at":"2026-08-06T21:07:25.446793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14519","last_updated":"2025-04-01T17:59:17Z","snapshot_observed_at":"2026-07-06T19:54:00.822571Z","submitted_at":"2024-11-21T16:45:43Z","title":"Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14519","snapshot_observed_at":"2026-08-06T21:07:25.504405Z","title":"Tra-moe: Learning trajectory prediction model from multiple domains for adaptive policy condition- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.504405Z"},"links":{"cited_paper":"/paper/2411.14519","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:23b98263143ccfec5e4a821a7c2f6c5616c5febd83b790a4b708149d6461677f","observation_id":"e1d8b0a8-5381-4bc9-bd51-22bf5b3618a4","resolution":{"observed_at":"2026-08-06T21:07:25.504405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-06T21:07:25.536516Z","title":"Latent action pretraining from videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.536516Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:128dc87e54c415cb2aa7a1af111c293a9368845c7bf76f2c9d50c9e6c3903de6","observation_id":"5a69ef97-ae9a-40d9-9334-e9c04c16722c","resolution":{"observed_at":"2026-08-06T21:07:25.536516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-06T21:07:25.595946Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.595946Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:d420e3b7b9e51acb6f17e1cf80a2d199089988ebe59c7c33f79afb5b44dedff1","observation_id":"1b81bb15-fd8f-409e-9e5f-108a76b3b3ba","resolution":{"observed_at":"2026-08-06T21:07:25.595946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:26.862780Z","title":"Soundstream: An end-to- end neural audio codec","venue":null,"work_id":"0e6a40e5-69f7-4db5-8a6c-bd0d3945afa8","year":2021},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.664555Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:ea1c253c3805ddd43ed00accb7b8980fbd395217547e5db8f530587cb75be65f","observation_id":"a4a5ee28-9536-481e-b8cc-fca2f56b8fbf","resolution":{"observed_at":"2026-08-06T21:07:26.923590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:25.702842Z","title":"Moviedreamer: Hierarchical generation for coherent long visual sequence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.702842Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:921ace39302a969055d0dc55aadbce012fb3d1f60b5478a0360af15d2c45b28e","observation_id":"296c81bb-282e-4713-b691-debf1cd58ac1","resolution":{"observed_at":"2026-08-06T21:07:25.702842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:25.791210Z","title":"Diception: A generalist diffusion model for visual perceptual tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.791210Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:1f2e50db552db7fa6d7900c7d427b07f33b9ba4ce08f838c7c67485ea2a7dda1","observation_id":"850984de-93ef-4ff3-ab41-3585a9bf2cea","resolution":{"observed_at":"2026-08-06T21:07:25.791210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T21:07:25.850810Z","title":"Learning fine-grained bimanual manipulation with low- cost hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.850810Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:494a19d957b0d0854de2cfde004772ea180dbbd80bdcec677813a6c1d5628fde","observation_id":"9b04ccf3-2d15-4542-855f-c4cece5049b7","resolution":{"observed_at":"2026-08-06T21:07:25.850810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13508","last_updated":"2025-02-21T07:01:56Z","snapshot_observed_at":"2026-07-06T20:39:02.049006Z","submitted_at":"2025-02-19T07:53:45Z","title":"VLAS: Vision-Language-Action Model With Speech Instructions For Customized Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13508","snapshot_observed_at":"2026-08-06T21:07:25.936596Z","title":"Vlas: Vision-language-action model with speech instructions for customized robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.936596Z"},"links":{"cited_paper":"/paper/2502.13508","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:8ae67d96fc943d9c459387597deb52f7e8c23e22c81a06b7401d9633c4190b0a","observation_id":"ef8e333e-3baf-4787-8619-ad432f15f447","resolution":{"observed_at":"2026-08-06T21:07:25.936596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T21:07:25.998032Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.998032Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:bfde9bd763bba88efb1ca10ad09c9f8306ca6d36e25ee959325f763b6050d80e","observation_id":"50648549-db24-47ed-9cd1-4360a95c363b","resolution":{"observed_at":"2026-08-06T21:07:25.998032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:07:26.771059Z","title":"Point cloud matters: Rethinking the impact of different observation spaces on robot learn- ing","venue":null,"work_id":"b702d064-62a1-4afe-83c0-1cbd7b119a8b","year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:26.049381Z"},"links":{"citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:f193ee4fba8403aae773733c4cdac598cfc2cd77e5020278bd8206b8ccc86d5c","observation_id":"cb1aa5e6-43e7-4995-b644-82f7e86dbef5","resolution":{"observed_at":"2026-08-06T21:07:26.828145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08208","last_updated":"2025-03-01T15:51:38Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:59:51Z","title":"SPA: 3D Spatial-Awareness Enables Effective Embodied Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08208","snapshot_observed_at":"2026-08-06T21:07:26.130586Z","title":"Spa: 3d spatial-awareness enables effective embodied representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:26.130586Z"},"links":{"cited_paper":"/paper/2410.08208","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:e6a7516f8a6f3ed916164545f07637ae1dbac913ce5891fd86d276974ca338d5","observation_id":"d873b553-398d-4f19-8b8c-2d544b0d7e47","resolution":{"observed_at":"2026-08-06T21:07:26.130586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T10:56:40.594954Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 14 inbound Pith citation observations for arXiv:2507.01016."}