{"as_of":"2026-08-19T05:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ee9cb207ea69e0f129b080b7ce8a6750b7697e631691e8425ca7d27ec833368","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:39:40.605712Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11671/citation-record","integrity":"/paper/2608.11671/integrity","json":"/paper/2608.11671/citation-record.json","paper":"/paper/2608.11671"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-16T00:39:40.159696Z","title":"Qwen3-VL Technical Report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.159696Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:73f36157fe9a8825392079f1d8d4a21022717bffedc3fbdbfefed2d6346c8d55","observation_id":"2f5c8d6a-811d-4c38-ab78-5befcc6692e4","resolution":{"observed_at":"2026-08-16T00:39:40.159696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-16T00:39:40.166058Z","title":"Rt-h: Action hierarchies using language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.166058Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:6dc21834d04063eac8886833de30a94235c2ade5c4c29b80120017dc03f577e1","observation_id":"67d75d5f-0648-4b58-b217-e545c44d0264","resolution":{"observed_at":"2026-08-16T00:39:40.166058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-08-16T22:05:17.066613Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-08-16T00:39:40.171426Z","title":"Motus: A Unified Latent Action World Model.arXiv preprint arXiv:2512.13030, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.171426Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:1c4466b975193dd4740cc44d399e194f305e4887222be7cb334f87fb7bd7d095","observation_id":"6dac024d-934a-4e63-9c28-17108811c050","resolution":{"observed_at":"2026-08-16T00:39:40.171426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-16T00:39:40.177152Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.177152Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:fd362fe9c967d22564960310df45db0bb78d203dd31cf9cb270ca974a0269abd","observation_id":"3d188d7a-3dcb-41a8-9f41-95057c8b2db6","resolution":{"observed_at":"2026-08-16T00:39:40.177152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-16T00:39:40.187843Z","title":"UniVLA: Learning to Act Anywhere with Task-Centric Latent Actions.arXiv preprint arXiv:2505.06111, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.187843Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:f765202e94fabb179cbb5ec4ad5f6552e21f6d0fbe62a8b3c6373d8f8a0cec7e","observation_id":"bc553b3e-ccae-4b9a-9985-c34c2ecf9c15","resolution":{"observed_at":"2026-08-16T00:39:40.187843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:40.193129Z","title":"See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations.arXiv preprint arXiv:2512.07582, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.193129Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:a70ff02bde881ebf618b963e0b96e02431fd7d9a4122bd12337148471bc0ffe8","observation_id":"0d1af0ab-83cc-4257-9d54-d35208203a99","resolution":{"observed_at":"2026-08-16T00:39:40.193129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-08-11T00:39:38.533421Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.13193","snapshot_observed_at":"2026-08-16T00:39:40.198497Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control.arXiv preprint arXiv:2602.13193, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.198497Z"},"links":{"cited_paper":"/paper/2602.13193","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:ebb5265c3c6c1464525eeae6116641fddda96fba51ecf049a664a332868a9011","observation_id":"35e919bf-d023-467d-b3ed-a0256c2a742f","resolution":{"observed_at":"2026-08-16T00:39:40.198497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-16T00:39:40.204306Z","title":"From intention to execution: Probing the generalization boundaries of vision-language-action models.arXiv preprint arXiv:2506.09930, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.204306Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:3ffb9492eeac366766d166ded654b38db284b7d9c04fbcd73b3875db6ab4fdca","observation_id":"78dbd86f-6df9-4060-87f0-f9c36e3b9296","resolution":{"observed_at":"2026-08-16T00:39:40.204306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-08-13T00:59:48.824306Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-16T00:39:40.209987Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language- Action Models.arXiv preprint arXiv:2510.13626, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.209987Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:3f48afe31f1a20024106e40142a69b3b8652862a09a8a7a3cb4a96249e8a4702","observation_id":"92387e10-3135-4277-ae10-736ecc3fef1a","resolution":{"observed_at":"2026-08-16T00:39:40.209987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:42.131556Z","title":"See what matters: Differentiable grid sample pruning for generalizable vision-language-action model","venue":null,"work_id":"6f2c8d2c-2e26-4d49-abb1-86f6695f3773","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.215675Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:777ccea01148dfbf532554d89e46002313d9cedcefb80512f24d619c9d48bf4f","observation_id":"59b30ab7-0fa0-4397-a48c-9c111f559777","resolution":{"observed_at":"2026-08-16T00:39:42.138077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-08-07T16:54:08.238920Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":2},"cited_work":{"arxiv_id":"2607.06988","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.06988","snapshot_observed_at":"2026-08-16T00:39:41.573842Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","venue":"cs.RO","work_id":"d498dbbb-91f5-46df-adb3-61e76b10d4b9","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.220903Z"},"links":{"cited_paper":"/paper/2607.06988","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:7814b110c408588f7c1d141fd477e3110a6e42a8218ba48a568b39a185471733","observation_id":"e1295b98-35fa-4107-820e-4a881ae8b493","resolution":{"observed_at":"2026-08-16T00:39:41.579937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:42.112170Z","title":"Icrt: In-context imitation learning via next-token prediction","venue":null,"work_id":"29079baf-d98b-4881-881e-db464b703be7","year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.226605Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:4e36adef7eeb175f974b29f9c5274399d751add5e266184e844529af0b366fee","observation_id":"f09b947f-1824-459f-b2ee-31d585b4c5ce","resolution":{"observed_at":"2026-08-16T00:39:42.118206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-16T00:39:40.231644Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.231644Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:78e3557233f62d1c034c53c66c04f82b876e50141a2469f8a7bc23720c0226a6","observation_id":"5ca88b4a-50bf-46f0-afc4-e195fcc9caa2","resolution":{"observed_at":"2026-08-16T00:39:40.231644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:40.237022Z","title":"Hancock, Xindi Wu, Lihan Zha, Olga Russakovsky, and Anirudha Majumdar","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.237022Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:1ac2f3c6d34806c453c8f13837b75599bae1627fee87a9ad025b00cec151a71f","observation_id":"b74b918f-6ff3-4a17-bc9a-f7d4e5c201ab","resolution":{"observed_at":"2026-08-16T00:39:40.237022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:42.091657Z","title":"Motion dynamics learning for few-shot embodied adaptation","venue":null,"work_id":"89ec7c20-f714-4e08-8992-2433c96625ff","year":null},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.241659Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:c6e699ce6257ffbfd4e29eb4a95267081f0017c230114ede632bca532dfdd535","observation_id":"bc03fbe7-39c9-4a07-a4cb-08641716db5b","resolution":{"observed_at":"2026-08-16T00:39:42.098520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:42.074084Z","title":"Thinkact: Vision-language- action reasoning via reinforced visual latent planning.Advances in Neural Information Processing Systems, 38: 82782–82802, 2026","venue":null,"work_id":"0d4aaced-6819-46c8-b7ef-12e585508566","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.246629Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:0e25b55ccf14161e9802c8cffe17577a1b69cdbe118354778dc5e776df7d577f","observation_id":"dc9ad96b-87e0-4072-bc9b-3499977baaba","resolution":{"observed_at":"2026-08-16T00:39:42.079782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02757","last_updated":"2026-05-04T15:57:07Z","snapshot_observed_at":"2026-08-11T00:21:08.790870Z","submitted_at":"2026-05-04T15:57:07Z","title":"Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02757","snapshot_observed_at":"2026-08-16T00:39:40.372922Z","title":"Seeing realism from simulation: Efficient video transfer for vision-language-action data augmentation.arXiv preprint arXiv:2605.02757, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.372922Z"},"links":{"cited_paper":"/paper/2605.02757","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:0cbc9c667068f2b4f7983080f3a67feda95d5f7503062cf3d054c8588b4abed3","observation_id":"21ad72bd-a67f-4dfd-a627-4ab833b294fc","resolution":{"observed_at":"2026-08-16T00:39:40.372922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-14T03:25:49.528763Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-16T00:39:40.378753Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks.arXiv preprint arXiv:2504.19854, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.378753Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:c620c8f16780bcc7c26daaf3ec6c3cf51f057764afae94912354b1f75a9462b6","observation_id":"289bd257-aba7-4d12-a147-a9f0cf32edeb","resolution":{"observed_at":"2026-08-16T00:39:40.378753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:42.055166Z","title":"Ra-vla: Retrieval- augmented vla for test-time adaptation","venue":null,"work_id":"c66c7772-a82a-49bd-afbc-28e7bfea8a83","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.383828Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:bb03c5ee27d12fa7768ef50947b930e9f0056bbc26b81b9e7e096605c7becf19","observation_id":"dd1e365e-fbf5-4751-a3d7-ed85140f453d","resolution":{"observed_at":"2026-08-16T00:39:42.061087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:42.034927Z","title":"Ra-vla: Retrieval- augmented vla for test-time adaptation","venue":null,"work_id":"8ebbfa1d-d952-4180-8224-7c0d3dcbf8cf","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.389054Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:f73a144e67175b0021c29bb8f2876f318be81dc0609c04ef5694498298e7aee4","observation_id":"767bc788-6f2e-467b-b80d-9b6644aeec2e","resolution":{"observed_at":"2026-08-16T00:39:42.040916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:42.013677Z","title":"RoboTTT: Context Scaling for Robot Policies.arXiv preprint, 2026","venue":null,"work_id":"5e8f5425-4988-4209-a48b-10c196d40b25","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.394348Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:0285413fea06e508dbf45671ab0e38cadf6b952d1016cfc2ff0ab0917024ea11","observation_id":"66fbaafc-a41f-4c2b-b8aa-67c6d9b5983c","resolution":{"observed_at":"2026-08-16T00:39:42.019250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-16T00:39:40.399303Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.399303Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:040c449233caa4e4f4f5639e82db92baa2e87bcacde80f14e472b6b85d2f0a6c","observation_id":"ebb4701a-c999-4648-a9d6-2ed844b4d514","resolution":{"observed_at":"2026-08-16T00:39:40.399303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-16T00:39:40.405179Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.405179Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:5b9f657e1f2fa6be44182fdc477b36be9525ce0ae701c191d1a9454a7af79a40","observation_id":"b433c465-28c0-4c40-9039-47a72fc38fa3","resolution":{"observed_at":"2026-08-16T00:39:40.405179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-08-14T09:44:01.476519Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-16T00:39:40.410246Z","title":"Molmoact: Action reasoning models that can reason in space.arXiv preprint arXiv:2508.07917, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.410246Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:e34fc4e2b0e3b1d1a56a96b71952c0f02eae64fd02108f1c3346c0d25531e2d4","observation_id":"0faafd41-c780-4e71-95a5-70a99bf761fd","resolution":{"observed_at":"2026-08-16T00:39:40.410246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-17T09:37:26.044348Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21046","snapshot_observed_at":"2026-08-16T00:39:40.416285Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification.arXiv preprint arXiv:2508.21046, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.416285Z"},"links":{"cited_paper":"/paper/2508.21046","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:e20a4ea373ae87ffaf1e3d73d82592eab970063b6c19d0eab26282f4246ff40f","observation_id":"af116d28-9cb8-4d60-be99-bb45c4d5b95f","resolution":{"observed_at":"2026-08-16T00:39:40.416285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.14950","last_updated":"2026-05-14T15:21:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T15:21:36Z","title":"Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.14950","snapshot_observed_at":"2026-08-16T00:39:40.421768Z","title":"Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model.arXiv preprint arXiv:2605.14950, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.421768Z"},"links":{"cited_paper":"/paper/2605.14950","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:6b544c2429f05a00e4f2d6966ec573940a5df7c111c079fe5ca527293d4b14b5","observation_id":"81313a33-46db-4747-aafb-d1ca6837f4af","resolution":{"observed_at":"2026-08-16T00:39:40.421768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27295","last_updated":"2026-06-26T13:05:58Z","snapshot_observed_at":"2026-08-15T04:27:25.784339Z","submitted_at":"2026-06-25T17:13:02Z","title":"LA4VLA: Learning to Act without Seeing via Language-Action Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.27295","snapshot_observed_at":"2026-08-16T00:39:40.432225Z","title":"La4vla: Learning to act without seeing via language-action pretraining.arXiv preprint arXiv:2606.27295, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.432225Z"},"links":{"cited_paper":"/paper/2606.27295","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:2cfedbbd45ff631e3a8555e2c42d827c4cbd4a358e9a2b20204e4e34d6f4e873","observation_id":"6a9848be-5e94-4b18-97ae-ed3eaedd743d","resolution":{"observed_at":"2026-08-16T00:39:40.432225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-16T00:39:40.437052Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning.arXiv preprint arXiv:2306.03310, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.437052Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:92c4c0499eca063a18762818b4e743022be2660bc2fe1c6201a9880b37d3ab9f","observation_id":"4b40be1e-1cc9-498f-b0fc-8bb09341e4e2","resolution":{"observed_at":"2026-08-16T00:39:40.437052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:41.995100Z","title":"LocoFormer: Generalist Locomotion via Long-Context Adaptation","venue":null,"work_id":"b903aa7f-a594-4cef-9152-25cd6c1bc6b9","year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.442473Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:a622349d0f5db6c3991902b0c97c312b7cfc7b62d193f501622c7eeaa57864ef","observation_id":"cea6bdc0-b60c-4b96-8748-1bd43bed470a","resolution":{"observed_at":"2026-08-16T00:39:42.000853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-16T00:39:40.447818Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.447818Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:4f3157f416fa43a63f15e8c7a0118c54ffaf3a90ae70598537c4e9008d69ef08","observation_id":"cb272567-7abf-4b62-a6ba-ad96b84fc08e","resolution":{"observed_at":"2026-08-16T00:39:40.447818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30457","last_updated":"2026-06-29T15:23:44Z","snapshot_observed_at":"2026-08-16T11:29:23.933470Z","submitted_at":"2026-06-29T15:23:44Z","title":"Behavior Prompting Policy: Demonstrations as Prompts for Manipulation","version":1},"cited_work":{"arxiv_id":"2606.30457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.30457","snapshot_observed_at":"2026-08-16T00:39:41.252600Z","title":"Behavior Prompting Policy: Demonstrations as Prompts for Manipulation","venue":"cs.RO","work_id":"2e8afd8b-d8a6-40b6-b3ce-1d03efea6b96","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.452698Z"},"links":{"cited_paper":"/paper/2606.30457","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:7d4f69c89397013bf88a6ae145bff773447acf424ace6c7c7c94cb1d80684946","observation_id":"984c62fa-cf3d-49b1-b3d5-6a27c331b914","resolution":{"observed_at":"2026-08-16T00:39:41.258504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:41.976177Z","title":"Action-aware dynamic pruning for efficient vision-language-action manipulation","venue":null,"work_id":"8229bd12-739e-42c8-b083-92dc20d58648","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.458321Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:fcac14fd0713a70ff6e2f5d20efa3948c727fd65c27b810793bf7cc5c1e75969","observation_id":"c8b74a6f-d11d-4d31-bba9-b692ebb2c443","resolution":{"observed_at":"2026-08-16T00:39:41.982044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-16T00:39:40.464253Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.464253Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:ed08e357e26776b675c5bd8027473a629fa1f6ae2e322477734704cb5f215aed","observation_id":"85f6ee72-9c7b-4f32-9dcb-9b5b11063e0c","resolution":{"observed_at":"2026-08-16T00:39:40.464253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-11T15:03:01.640683Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-16T00:39:40.470070Z","title":"π0.7: A Steerable Generalist Robotic Foundation Model with Emergent Capabilities.arXiv preprint arXiv:2604.15483, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.470070Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:721af42f946193f7750d8f369b542fbe2ab7e4eec151e5730a92a78146c83a27","observation_id":"93bb0d3b-252d-4ab8-bff1-f5be796a5a06","resolution":{"observed_at":"2026-08-16T00:39:40.470070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-16T00:39:40.475421Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.475421Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:50dfadee0a4076f596b6b7d6fa6569ff862706c6df4b3331de23ad7994d0e860","observation_id":"0b5fe059-9135-45c7-92f3-d01d315ab801","resolution":{"observed_at":"2026-08-16T00:39:40.475421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17846","last_updated":"2026-06-17T17:06:39Z","snapshot_observed_at":"2026-08-18T04:06:48.500842Z","submitted_at":"2026-06-16T12:14:39Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17846","snapshot_observed_at":"2026-08-16T00:39:40.480220Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models.arXiv preprint arXiv:2606.17846, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.480220Z"},"links":{"cited_paper":"/paper/2606.17846","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:0dd55432706faf5a96f5bb778f3069ac1aa9d2856a5f281d54db0300aa3d4536","observation_id":"70f45c2d-7d60-4706-93b6-f443ff7cef90","resolution":{"observed_at":"2026-08-16T00:39:40.480220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-16T00:39:40.485551Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation.arXiv preprint arXiv:2508.19236, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.485551Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:edaa369b58239824fa8c5ef234d73fc560bb22ff312f4e1fc42deb506bec2082","observation_id":"cc00cbe3-e0d0-45ba-b9f1-25cf18ce645f","resolution":{"observed_at":"2026-08-16T00:39:40.485551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-18T04:25:30.115862Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-16T00:39:40.491234Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics.arXiv preprint arXiv:2506.01844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.491234Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:b8c835dedbe37d748caba6c9c096628c071fbcadeda7dd8f51d55bb88d3c424a","observation_id":"a0b64ab9-d276-4788-96aa-e8b824aea016","resolution":{"observed_at":"2026-08-16T00:39:40.491234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02062","last_updated":"2025-08-04T05:01:11Z","snapshot_observed_at":"2026-08-10T10:00:27.641182Z","submitted_at":"2025-08-04T05:01:11Z","title":"RICL: Adding In-Context Adaptability to Pre-Trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02062","snapshot_observed_at":"2026-08-16T00:39:40.496275Z","title":"Ricl: Adding in-context adaptability to pre-trained vision-language-action models.arXiv preprint arXiv:2508.02062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.496275Z"},"links":{"cited_paper":"/paper/2508.02062","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:bdc423a1f67ce38ec34dd961b84a163e6582c59be175d5c8deb27cb1acbfa6c9","observation_id":"7b68db90-0d21-4b5d-8502-9ea65dd1f2be","resolution":{"observed_at":"2026-08-16T00:39:40.496275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-08-11T13:37:09.952888Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-08-16T00:39:40.501945Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing.arXiv preprint arXiv:2604.05014, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.501945Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:9fb29a80a45aa90aa46009b348a1d0b4786cd46f81a6ec2e3a090fd57dd09eaf","observation_id":"f1865d81-e0a2-4a80-8d75-fcf68bc8ea9b","resolution":{"observed_at":"2026-08-16T00:39:40.501945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.13231","last_updated":"2020-07-01T18:09:39Z","snapshot_observed_at":"2026-08-10T06:17:50.182021Z","submitted_at":"2019-09-29T08:09:15Z","title":"Test-Time Training with Self-Supervision for Generalization under Distribution Shifts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.13231","snapshot_observed_at":"2026-08-16T00:39:40.508228Z","title":"Efros, and Moritz Hardt","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.508228Z"},"links":{"cited_paper":"/paper/1909.13231","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:94a0f39338904d98549a4b4e5a0d30ff7375e2a86d87a89995aa8d3ac6224ef4","observation_id":"19f7e96f-fdaa-4a2a-988f-5868b448f60d","resolution":{"observed_at":"2026-08-16T00:39:40.508228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07934","last_updated":"2026-06-06T01:50:59Z","snapshot_observed_at":"2026-08-01T15:24:36.891316Z","submitted_at":"2026-06-06T01:50:59Z","title":"X-OP: Cross-Morphology Whole-Body Teleoperation via MPC Retargeting","version":1},"cited_work":{"arxiv_id":"2606.07934","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.07934","snapshot_observed_at":"2026-08-16T00:39:41.061012Z","title":"X-OP: Cross-Morphology Whole-Body Teleoperation via MPC Retargeting","venue":"cs.RO","work_id":"d9c130fc-202f-4065-8e1e-95584a1d6d85","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.514334Z"},"links":{"cited_paper":"/paper/2606.07934","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:6cdce98025a1d76c690942afceb78ae1ccb9fd1be6dd312510ec34b95f6ccff4","observation_id":"41f76f0c-886c-4559-8c30-c280a22a1732","resolution":{"observed_at":"2026-08-16T00:39:41.067131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06403","last_updated":"2026-07-07T15:33:12Z","snapshot_observed_at":"2026-08-06T21:08:13.002956Z","submitted_at":"2026-07-07T15:33:12Z","title":"From Foundation to Application: Improving VLA Models in Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.06403","snapshot_observed_at":"2026-08-16T00:39:40.520150Z","title":"From Foundation to Application: Improving VLA Models in Practice.arXiv preprint arXiv:2607.06403, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.520150Z"},"links":{"cited_paper":"/paper/2607.06403","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:8af2f945a96ad5f929cf5f5ac34ad6364d476c5822d594fdc820b6be14757b71","observation_id":"479b66dc-ecf4-4bec-b458-164d4580e070","resolution":{"observed_at":"2026-08-16T00:39:40.520150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:41.958964Z","title":"A V A-VLA: Improving Vision-Language-Action Models with Active Visual Attention","venue":null,"work_id":"917680d8-4a49-4f95-a7e0-53e1412e24ad","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.525612Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:074e01048830db8b16de896fde6770615f97b0cb1d706633ffa2c8eacd177092","observation_id":"70ca2af7-44b9-4716-b5d6-e4d845a1c7b2","resolution":{"observed_at":"2026-08-16T00:39:41.964349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:41.940811Z","title":"Towards efficient embodied reasoning: Mixture-of-depth compute allocation for vision- 17 language-action model","venue":null,"work_id":"43dd3b8f-9d98-4e76-a58b-f98e7c6f7d20","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.530558Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:1ce79a94d812b333dd8583a3b8681597813fa7587eaf0f0f54150b523a478945","observation_id":"afe0bddc-4a58-4ea8-9541-71736e7cf7f9","resolution":{"observed_at":"2026-08-16T00:39:41.947017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:40.535540Z","title":"Vla-cache: Efficient vision- language-action manipulation via adaptive token caching.Advances in Neural Information Processing Systems, 38:164448–164473, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.535540Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:452da50f9c7574b380eba2ea4b7c5812da88abafaa4974b3664fac7dbd314b1d","observation_id":"878b0789-b711-4571-8299-f330b4f86d39","resolution":{"observed_at":"2026-08-16T00:39:40.535540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:41.913258Z","title":"Affordance field intervention: Enabling vlas to escape memory traps in robotic manipulation","venue":null,"work_id":"a8942893-e4ad-4e69-b587-122d0cd14181","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.541031Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:c69ec5d0b7bffe2686b8864a1f6e07b2028fb669f70d506f8fa7300884e65378","observation_id":"45094728-647b-4228-89c2-1813c683421f","resolution":{"observed_at":"2026-08-16T00:39:41.918310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-08-12T08:06:42.236760Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-16T00:39:40.545967Z","title":"Latent Action Pretraining from Videos.arXiv preprint arXiv:2410.11758, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.545967Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:b544e8961734bdf729cbd67c4cff7229973ed24daf607480855fa32a756182da","observation_id":"ce9f1612-a1dc-4988-9b10-dde7eb44ebcf","resolution":{"observed_at":"2026-08-16T00:39:40.545967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-16T00:39:40.551955Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.551955Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:027b2e060e722a0f998877410391b203b095123a10d410722512fe95c8b1b931","observation_id":"60d41e58-ce4f-472d-984a-7d2b30795eae","resolution":{"observed_at":"2026-08-16T00:39:40.551955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:40.557935Z","title":"Hancock, Mingtong Zhang, Tenny Yin, Yixuan Huang, Dhruv Shah, Allen Z","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.557935Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:562f5e07fe27c1b06c03570528440d3936c8c6569216371e25961d9565d06987","observation_id":"bc9939bf-886c-425e-a7e4-3c06e6301528","resolution":{"observed_at":"2026-08-16T00:39:40.557935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.22539","last_updated":"2026-08-07T13:52:17Z","snapshot_observed_at":"2026-08-14T15:03:39.725206Z","submitted_at":"2025-12-27T09:40:54Z","title":"VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.22539","snapshot_observed_at":"2026-08-16T00:39:40.562799Z","title":"VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.562799Z"},"links":{"cited_paper":"/paper/2512.22539","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:904c9276d2af9a14cbf9953e749c1883ad193f5ed7fe3e59e954f9ec3ae28568","observation_id":"4b74d118-0022-4d72-b5a7-8e64f05164a0","resolution":{"observed_at":"2026-08-16T00:39:40.562799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.31382","last_updated":"2026-06-30T09:10:31Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:10:31Z","title":"Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation","version":1},"cited_work":{"arxiv_id":"2606.31382","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.31382","snapshot_observed_at":"2026-08-16T00:39:40.742626Z","title":"Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation","venue":"cs.RO","work_id":"9d3a33d3-e5c6-4071-b0be-0314fae0684c","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.568412Z"},"links":{"cited_paper":"/paper/2606.31382","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:d8a9f9d33e94e02be410a1c8ccebed38e1f9c3abfe8dbf9228d5481890ba01dd","observation_id":"17528a3f-09df-4915-b63c-4472aee2cf7d","resolution":{"observed_at":"2026-08-16T00:39:40.751326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03127","last_updated":"2026-06-02T04:10:39Z","snapshot_observed_at":"2026-08-17T01:11:56.796853Z","submitted_at":"2026-06-02T04:10:39Z","title":"TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03127","snapshot_observed_at":"2026-08-16T00:39:40.574154Z","title":"TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models.arXiv preprint arXiv:2606.03127, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.574154Z"},"links":{"cited_paper":"/paper/2606.03127","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:b8a76f97345b1a28258ae55bbaac32b453694006ec2352293054d2b4cb4c217c","observation_id":"c9c63866-d224-4bf7-840f-dddfeabfb829","resolution":{"observed_at":"2026-08-16T00:39:40.574154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-16T00:39:40.579241Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge.arXiv preprint arXiv:2507.04447, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.579241Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:58bf8ae319ca11365c4a6791c55ef663cce2bf4d2f3e258ec5795eed0d142f89","observation_id":"106b0c91-6b38-467a-8957-6146547487af","resolution":{"observed_at":"2026-08-16T00:39:40.579241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:41.895254Z","title":"Retrieval-VLA: Training-Free In-Context Adaptation for Vision-Language-Action Models","venue":null,"work_id":"50b4e7d9-9361-46d1-ad4f-c2140136e82a","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.584585Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:d4f8bfeadff5b840f94a2f46608e8e3c0e7c21d1fd8c6fcd252d36d29584fa6e","observation_id":"d009941a-08dc-4f66-b5a6-f5cbe72df6a1","resolution":{"observed_at":"2026-08-16T00:39:41.901566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:41.876736Z","title":"Retrieval-vla: Training-free in-context adaptation for vision-language-action models","venue":null,"work_id":"30bfa314-b5a0-4f7d-8487-031b1f64a3bf","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.590092Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:34ab553f83013c27fa145e262ece88ce6f5040297f6cb04e1a853ac153d5bab6","observation_id":"af0c0057-cb24-4949-a60b-f467895629d2","resolution":{"observed_at":"2026-08-16T00:39:41.882434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-18T09:32:30.308050Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-16T00:39:40.595363Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models.arXiv preprint arXiv:2503.22020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.595363Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:4f8588913802ab65b7c08cabf00a3638ec6e8b3ea49fe6398624e6a4b1e5148d","observation_id":"0f32b0c2-d391-4553-90e7-afdd546692c2","resolution":{"observed_at":"2026-08-16T00:39:40.595363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:41.857952Z","title":"ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models","venue":null,"work_id":"92e55910-65de-42cf-86ff-889af8259874","year":2026},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.600800Z"},"links":{"citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:b96d59b5c54a4825dc04e59a327adc84dd6e2faef0ecfd2e47a9a7f752b62a7f","observation_id":"d1be27be-a1ef-4583-917c-99e785ed12d8","resolution":{"observed_at":"2026-08-16T00:39:41.864856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03827","snapshot_observed_at":"2026-08-16T00:39:40.605712Z","title":"subtask + 3D/2D steering command","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.605712Z"},"links":{"cited_paper":"/paper/2510.03827","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:4a635a33a0083548c0f0a525d857f9a8d306ab3dfc44c7b2c093365794ca4528","observation_id":"0f1c1164-5e90-4490-af96-a4da7be0e23c","resolution":{"observed_at":"2026-08-16T00:39:40.605712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":4,"verified_fuzzy":15},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2608.11671."}