{"as_of":"2026-08-04T12:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b39f88c0173a9ce5ea31fe48fb62d3f0a6786e953918cdeeb45038c6137abd0e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:22:12.185580Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.11567/citation-record","integrity":"/paper/2605.11567/integrity","json":"/paper/2605.11567/citation-record.json","paper":"/paper/2605.11567"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T02:22:06.931370Z","title":"pi-0.5: a vision- language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:06.931370Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:57b20a4b2f81ef1e676f9a1981d64cd05f2d8e4ba2b5100497e4422ce45d67e9","observation_id":"2a7f7105-a63f-4da7-afeb-2caca8aba287","resolution":{"observed_at":"2026-08-03T02:22:06.931370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-03T02:22:07.003244Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:07.003244Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:3b67b0c79d710fe1ca3236d6e643e44f9a5cecddba663b2021171aaf64a3cc18","observation_id":"7f1a23b7-b75d-451a-9b2c-78ee86a519fb","resolution":{"observed_at":"2026-08-03T02:22:07.003244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-07-06T22:00:18.950986Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-08-03T02:22:07.106510Z","title":"Gr-3 technical report.arXiv preprint arXiv:2507.15493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:07.106510Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:4af39e1c9d580bc8a9d4266ad44b717bca151f8fe6d4bb6181d68d829065768e","observation_id":"5bf6bb77-a40a-416b-acb8-1a74129a44c6","resolution":{"observed_at":"2026-08-03T02:22:07.106510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:07.156860Z","title":"A survey on efficient vision-language-action models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:07.156860Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:7e52bd1f65b084a65ab789a15eceeac31c40fbe74dc34434132ff7bbb5abdabe","observation_id":"ac59e48d-6cd2-497c-bfe5-007577491097","resolution":{"observed_at":"2026-08-03T02:22:07.156860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-03T02:22:07.297151Z","title":"A survey on vision- language-action models for embodied ai, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:07.297151Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:23156be43dd6868bceaf4cb6a71f45f20c0a573dab2ced985f3abaf5f98943bf","observation_id":"e59e3762-159b-4cb7-a370-0c64792c72dc","resolution":{"observed_at":"2026-08-03T02:22:07.297151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13073","snapshot_observed_at":"2026-08-03T02:22:07.432442Z","title":"Large vlm-based vision-language-action models for robotic manipulation: A survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:07.432442Z"},"links":{"cited_paper":"/paper/2508.13073","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:41a012b9788f5bdf9bc1a8a7eb4098d6406a7a2fd29e8274fa31c95cf1aef923","observation_id":"2dbeea7a-3807-4074-9f26-2c533b20084d","resolution":{"observed_at":"2026-08-03T02:22:07.432442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-03T02:22:07.560575Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:07.560575Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:92a050fb28a77ca94c89452120520651bd3cb5a8099ae140641f22741009d815","observation_id":"0c1a6d0a-57fb-411c-95a4-3d007c8949ae","resolution":{"observed_at":"2026-08-03T02:22:07.560575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:07.755484Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:07.755484Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:ec40d1e910c8e7b555c85b4095e875c274b534786ebc83e2ba2ea6e99804c65b","observation_id":"3dc035b0-57b7-4855-bc45-7396e947fa29","resolution":{"observed_at":"2026-08-03T02:22:07.755484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-03T02:22:07.894813Z","title":"pi-0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:07.894813Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:184dfcf7c56b4b201fcd1d473b952d1270410c2014abd8d226ae245375914188","observation_id":"ff704b32-c35a-4195-8816-1c80db7bdcd1","resolution":{"observed_at":"2026-08-03T02:22:07.894813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19433","last_updated":"2026-05-29T16:37:52Z","snapshot_observed_at":"2026-08-03T20:32:24.421072Z","submitted_at":"2025-11-24T18:59:51Z","title":"Mixture of Horizons in Action Chunking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19433","snapshot_observed_at":"2026-08-03T02:22:08.031430Z","title":"Mixture of horizons in action chunking.arXiv preprint arXiv:2511.19433, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:08.031430Z"},"links":{"cited_paper":"/paper/2511.19433","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:ea23c129886b234ac049c7afbccfdd044b06956b924563bca1308a233ed6cdc7","observation_id":"209fea6c-e3ed-4bda-a7b3-1b0b3ebc8f33","resolution":{"observed_at":"2026-08-03T02:22:08.031430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:08.172184Z","title":"Everydayvla: A vision-language-action model for affordable robotic manipulation.arXiv preprint arXiv:2511.05397, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:08.172184Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:339df24648b1829b32b7e2b6603a24dbcecf09d3bcc5d71c79ea7aae966db061","observation_id":"7c541ce8-1ed5-4410-8d44-d123106971f3","resolution":{"observed_at":"2026-08-03T02:22:08.172184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.21445","last_updated":"2026-06-20T22:55:52Z","snapshot_observed_at":"2026-08-02T21:06:07.003435Z","submitted_at":"2026-02-24T23:48:48Z","title":"VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.21445","snapshot_observed_at":"2026-08-03T02:22:08.325169Z","title":"Vla knows its limits.arXiv preprint arXiv:2602.21445, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:08.325169Z"},"links":{"cited_paper":"/paper/2602.21445","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:9a412246efdecf5b4598a5784ca563b7c42e964930191dcade302a11be37ed0b","observation_id":"cc392276-051d-47a8-be2c-86b6f297c04b","resolution":{"observed_at":"2026-08-03T02:22:08.325169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10781","snapshot_observed_at":"2026-08-03T02:22:08.497050Z","title":"When attention sink emerges in language models: An empirical view.arXiv preprint arXiv:2410.10781, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:08.497050Z"},"links":{"cited_paper":"/paper/2410.10781","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:6a7d0ce3684e6f336c0037bf0f79d2532c9446be8dab71ea054896e9f08e1738","observation_id":"5a5d4806-4eaf-46c7-8954-c1d6d6a95713","resolution":{"observed_at":"2026-08-03T02:22:08.497050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:08.696196Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:08.696196Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:e69952a3177eb9101174945156734ac431989cbe547e8ac65b5a099a0f39293b","observation_id":"fefba4e1-46d6-4ab2-9b2d-35a89426ae4a","resolution":{"observed_at":"2026-08-03T02:22:08.696196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:08.879526Z","title":"Self speculative decoding for diffusion large language models.arXiv preprint arXiv:2510.04147, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:08.879526Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:5ded7fca9d2bb79f04da64eb614e72d76303fab359872752bef2507e4874a960","observation_id":"11c11b36-e1aa-4bc0-b7ee-b9b67c338b4e","resolution":{"observed_at":"2026-08-03T02:22:08.879526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:09.072854Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:09.072854Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:b019704dad46fe177e2e8cbdff3c7b3e2010af6bae235b40d2c18d574d884591","observation_id":"76340ea8-2c73-46dd-b74a-f8a3f9584994","resolution":{"observed_at":"2026-08-03T02:22:09.072854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:09.190850Z","title":"Spatialvla: Exploring spatial representations for visual-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:09.190850Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:2088faf753e9f3124e7949a946ba4e05d703f7b0cf82d6c9d17ae497682f31f8","observation_id":"b3050c0f-cd48-4cfe-9ec9-c29ea71251d2","resolution":{"observed_at":"2026-08-03T02:22:09.190850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:09.305040Z","title":"Learning to act anywhere with task-centric latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:09.305040Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:699041d03f1cd23f77cc33da66b8e7dc579ecaebf81ab03be47e1e89dced7080","observation_id":"fddfc4b1-f23a-4f22-a939-022d50d0837b","resolution":{"observed_at":"2026-08-03T02:22:09.305040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T02:22:09.414578Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:09.414578Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:f35e97017b472ce291e9269959bd4d3ccb7b6916c24fd6557ecba302baf1f9cf","observation_id":"2d54e74b-104d-4d55-9320-83c72e3d62ef","resolution":{"observed_at":"2026-08-03T02:22:09.414578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-03T02:22:09.546906Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:09.546906Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:dfba2af23fcbdd13d433e4c1a6ea6c75844fc676e5074ae42d70555e93093994","observation_id":"200210d7-aa40-4a02-8d57-39693490282d","resolution":{"observed_at":"2026-08-03T02:22:09.546906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-03T02:22:09.666825Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:09.666825Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:94ee7baafb61e589aa59d630c63fa92d41ba254f50eea3bd29099eed2459ddcb","observation_id":"cadde242-f550-4b9b-a2b8-80a992472f94","resolution":{"observed_at":"2026-08-03T02:22:09.666825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-04T10:58:38.750074Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-03T02:22:09.788854Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:09.788854Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:96db2730816072d0d27b372fa481dd504b268cdbd642250ff8e26242db9c865a","observation_id":"af253bd8-b7fd-4772-8a49-77ac4e85ad0a","resolution":{"observed_at":"2026-08-03T02:22:09.788854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-03T00:02:57.373313Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-03T02:22:09.891100Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:09.891100Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:63b25c3771e55935f97a3534b5ba3759778c3eb03832c16afffb47bc27db870d","observation_id":"2556e9c7-65b8-4d53-85f2-2e34bdd5a4c0","resolution":{"observed_at":"2026-08-03T02:22:09.891100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:10.035038Z","title":"PD-VLA: Accelerating vision-language-action model integrated with action chunking via parallel decoding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:10.035038Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:bfb2db0b7e75088318465e9ba4a403515c8482e2b32470df8b674106cda3873d","observation_id":"5dced491-f9c9-4d15-938d-6c924b9bae00","resolution":{"observed_at":"2026-08-03T02:22:10.035038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:10.162017Z","title":"Freqpolicy: Efficient flow-based visuomotor policy via frequency consistency, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:10.162017Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:02c35108e4335ec6687d70e5b665a769e3c1553d592ff74707aa8bc236c5f91c","observation_id":"71d71118-752f-4c69-ad20-05ba679736a8","resolution":{"observed_at":"2026-08-03T02:22:10.162017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:10.223113Z","title":"Zhao et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:10.223113Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:71af151178253f6553646983944eae8ff08a922d9edb51ee9695a4d670c3e32a","observation_id":"6ba54d14-0f91-44ec-9964-1be5c64c724e","resolution":{"observed_at":"2026-08-03T02:22:10.223113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:10.317638Z","title":"CALVIN: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks.IEEE Robotics and Automation Letters, 7(3):7327–7334, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:10.317638Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:4d1f128310815963efd43cf78a000540eccbc8a558ff4ba2156daacce547f12f","observation_id":"ecb54611-b6a3-4c1f-938d-eb63d4a8d301","resolution":{"observed_at":"2026-08-03T02:22:10.317638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:10.385010Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:10.385010Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:e241c9c198817748c1b13dee515e981647a2cdb0cabf436351ddda2169215e52","observation_id":"b48e970b-b88e-4b7d-9dc9-44bfc81f887f","resolution":{"observed_at":"2026-08-03T02:22:10.385010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:10.558041Z","title":"DROID: A large-scale in-the-wild robot manipulation dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:10.558041Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:1b672e8d043b3f176d01c5592c1936fe0b81d5d970bb207c2624550856ad3996","observation_id":"82c3e625-23fa-4166-b414-8db378dc9994","resolution":{"observed_at":"2026-08-03T02:22:10.558041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04062","last_updated":"2025-06-29T07:13:36Z","snapshot_observed_at":"2026-07-06T20:02:08.313625Z","submitted_at":"2024-12-05T10:57:08Z","title":"ZipAR: Parallel Auto-regressive Image Generation through Spatial Locality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04062","snapshot_observed_at":"2026-08-03T02:22:10.696480Z","title":"Zipar: Accelerating autoregressive image generation through spatial locality.arXiv preprint arXiv:2412.04062, 2(3):4, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:10.696480Z"},"links":{"cited_paper":"/paper/2412.04062","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:f5485d824813d9c1a569aab7d717abad93365695d40f3559a7b2ef178791e428","observation_id":"f124a09e-abfa-4661-9154-5c5c5ec37624","resolution":{"observed_at":"2026-08-03T02:22:10.696480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06916","last_updated":"2025-03-06T03:04:44Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:15:30Z","title":"SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06916","snapshot_observed_at":"2026-08-03T02:22:10.843139Z","title":"Swift: On-the-fly self- speculative decoding for llm inference acceleration.arXiv preprint arXiv:2410.06916, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:10.843139Z"},"links":{"cited_paper":"/paper/2410.06916","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:b6994c3d226d4bae8bd70d36340584e2221af4906d2716d40e44c415e8a14e22","observation_id":"50702319-fe68-4e13-a93b-41678de4ef0c","resolution":{"observed_at":"2026-08-03T02:22:10.843139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-03T02:22:11.010787Z","title":"Large language diffusion models.arXiv preprint arXiv:2502.09992, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.010787Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:23b04b218c120bcfd2891c3ef6d3763c44e9110d5555101d09147067aca204bd","observation_id":"183f983e-9aef-4863-8ad3-b9deea0ebd2d","resolution":{"observed_at":"2026-08-03T02:22:11.010787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-03T10:27:17.903246Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-08-03T02:22:11.160316Z","title":"Explain before you answer: A survey on compositional visual reasoning.arXiv preprint arXiv:2508.17298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.160316Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:c6b176e8e1e5a2c4a9117c11bd984b9e5b00d3fa3ab4836855d3b29148788299","observation_id":"f249f835-12cb-48f8-ad7b-7876f7ebab44","resolution":{"observed_at":"2026-08-03T02:22:11.160316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:11.235246Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.235246Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:bc19b90041226f30431429bb1ef769791ddf81d5a596dfcf2172f13bde7a03ad","observation_id":"1ef1300d-88b5-4ac9-ac8c-66e244280680","resolution":{"observed_at":"2026-08-03T02:22:11.235246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:11.445579Z","title":"An overview of model predictive control.Interna- tional Journal of control and automation, 3(4):47–63, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.445579Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:2c4d3441b52bdedcaaea7bd36263617ba417b53c231b7474ce612258609bb32c","observation_id":"12ddbf59-00b6-4940-99b6-515cfeb5c2cb","resolution":{"observed_at":"2026-08-03T02:22:11.445579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:11.520908Z","title":"Model predictive control.Switzerland: Springer International Publishing, 38(13-56):7, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.520908Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:61acc096fcb708a7c525cda91175b7235a409c7171b6d1eb946dadf62242f331","observation_id":"c122b5e1-f9c8-43dd-9929-0910f903ee28","resolution":{"observed_at":"2026-08-03T02:22:11.520908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:11.708385Z","title":"Nanovla: Routing decoupled vision-language understanding for nano-sized generalist robotic policies.arXiv preprint arXiv:2510.25122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.708385Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:e8d58df3a15c7da4c95b16b47f7bcdd3ebe04f7eec54247bebda4f35a7f47a6d","observation_id":"67d4fa08-59e3-4f19-a55e-f67d173bc27f","resolution":{"observed_at":"2026-08-03T02:22:11.708385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:11.871777Z","title":"The kinematics of contact and grasp.The International Journal of Robotics Research, 7(3):17–32, 1988","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.871777Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:32449f156a7324001069d7a6b5388f0f5020b3aed0e8e145eda58120bceab559","observation_id":"acec9d49-af94-4fd0-9c26-651a24b2d05f","resolution":{"observed_at":"2026-08-03T02:22:11.871777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:11.968192Z","title":"Rlinf-user: A unified and extensible system for real-world online policy learning in embodied ai.arXiv preprint arXiv:2602.07837, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.968192Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:7c60c80015260931771a9572e57a96ef561626f50a5fd15640b74304e99dfd4e","observation_id":"3dcc300f-384e-45ce-b308-49f179a58360","resolution":{"observed_at":"2026-08-03T02:22:11.968192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-07-06T11:34:01.629249Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-08-03T02:22:12.064595Z","title":"Maniskill: Generalizable manipulation skill benchmark with large-scale demonstrations.arXiv preprint arXiv:2107.14483, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:12.064595Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:32581fe916bd20009bb72d6df867dafa446d0bbb65316406a35026872300a847","observation_id":"0f1ed635-758d-4c15-ae1b-a71ced8489dd","resolution":{"observed_at":"2026-08-03T02:22:12.064595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:12.185580Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:12.185580Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:5ac7d26b894e87a3d83bec85fd1c963d9a1bf813aaff7efbbfbb21b58dcbfc34","observation_id":"0f41e96e-a630-4e9a-88b7-023b8d16fad9","resolution":{"observed_at":"2026-08-03T02:22:12.185580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T02:22:11.311647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T02:22:11.311647Z"},"links":{"citing_paper":"/paper/2605.11567"},"observation_digest":"sha256:489e199a763dab1d77c8df758bab451596ade2686477e458542b0f3fede35f99","observation_id":"adf8fd48-9def-4043-b2f2-e622edd40329","resolution":{"observed_at":"2026-08-03T02:22:11.311647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.11567","last_updated":"2026-07-31T00:59:10Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T12:09:53.748627Z","submitted_at":"2026-05-12T05:52:58Z","title":"Dynamic Execution Commitment of Vision-Language-Action Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2605.11567."}