{"as_of":"2026-08-06T18:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e2b793ba2d909f8f4f9590d3e715ca20239d4508227a1ec9a773370280991bab","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T10:54:16.265155Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02466/citation-record","integrity":"/paper/2607.02466/integrity","json":"/paper/2607.02466/citation-record.json","paper":"/paper/2607.02466"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:12fbaad2af9561e82ca2ec47a743cc285bae70d9ea6bd4a87da2818dd5c1d4cb","observation_id":"96793531-7075-4622-8205-b6ccc4148553","resolution":{"observed_at":"2026-07-03T10:58:02.522836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.996163Z","title":"Sanketi, Quan Vuong, Thomas Kollar, Benjamin Burchfiel, Russ Tedrake, Dorsa Sadigh, Sergey Levine, Percy Liang, and Chelsea Finn","venue":null,"work_id":"b1c0f9b4-9dc9-4d27-9d5b-8b68e7d572c2","year":2024},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:9cbf574fd37030ece2f8c028b1e64b21d57ff31b7a8beda018e065a70f13a2b1","observation_id":"3a390361-0217-45d3-8ebe-080cba713b4c","resolution":{"observed_at":"2026-07-05T09:10:52.997703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:6f83894c6104b4476216e63d7b89f037e526240c760b3f0ac1f3609d687979e6","observation_id":"68c8662c-56d2-4911-84fa-1814fab55a9d","resolution":{"observed_at":"2026-07-03T10:58:02.137451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:6479d1bf985333211b05bfcc573b8f9303e5b3419f967981675d696b5d634cbe","observation_id":"a47846f3-9802-425c-b589-a75a044203a4","resolution":{"observed_at":"2026-07-03T10:58:02.515724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:88e05b8a2e280a06dedc41e407ed2efc0c43baa65f4d5996af6f12db9429dee9","observation_id":"87ee7cd9-599b-4b27-bf5c-aa37e4efd879","resolution":{"observed_at":"2026-07-03T10:58:02.114886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.967052Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models","venue":null,"work_id":"ab55adc5-ceeb-4105-9257-9ab77c2ace1d","year":2024},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:65467014c0cdcaa1d6b5f322c2c407aad237d8cfd3f5fedd915f850d5116faa4","observation_id":"f9aace49-9388-4fc2-a40d-7db77487ee00","resolution":{"observed_at":"2026-07-05T09:10:52.968506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.972793Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"c3951c98-59ee-456d-998d-38aeb8492189","year":2023},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:8e8a738403902fd1545af7b83745d73044ac6607423d3024b622f31f076c45b6","observation_id":"30e7e67b-6b06-402c-b948-09bee3b963d8","resolution":{"observed_at":"2026-07-05T09:10:52.974568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:410f60f19bec1b9f443ef82c451f888457dfc2ebe21d5fd96a9701b9117f216d","observation_id":"a987011c-feee-4b9d-a21b-59fb272f2b5b","resolution":{"observed_at":"2026-07-03T10:58:02.518152Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.969056Z","title":"It’s the journey , not the destination: Locomotor explo- ration in infants","venue":null,"work_id":"39599a33-d4ee-42fc-9312-d4fe845d5360","year":2019},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:553fe7f1500f06c7c2b247d5a1693ce1d5522d5ef8bcc4917991aaa5dc1ff8d4","observation_id":"734f13d2-ef4a-40cb-a26f-bffc19afb4f3","resolution":{"observed_at":"2026-07-05T09:10:52.970238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.971051Z","title":"The psychology and neuroscience of curiosity","venue":null,"work_id":"4e0e3745-77d8-413e-837b-36305772a249","year":2015},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:31186b62958c720d656aa72b26195c66d78adde27d2567edc7eb1371e614d970","observation_id":"05c57aec-a2e3-4878-bfd4-2cab44aa332d","resolution":{"observed_at":"2026-07-05T09:10:52.972152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.975277Z","title":"Motor development: Embodied, embedded, enculturated, and enabling","venue":null,"work_id":"d74cb235-6737-4da9-9488-efbd19ead4ff","year":2019},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:edba790b8904af73d3b932f93c90037b831760d43b7b3f37e2db3f99ae1bddc8","observation_id":"a5ed48fe-1a79-41ee-bf21-4fca340c55d3","resolution":{"observed_at":"2026-07-05T09:10:52.976953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16985","last_updated":"2023-10-25T17:59:44Z","snapshot_observed_at":"2026-08-04T10:23:16.792671Z","submitted_at":"2023-05-26T14:40:46Z","title":"Inverse Dynamics Pretraining Learns Good Representations for Multitask Imitation","version":2},"cited_work":{"arxiv_id":"2305.16985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.16985","snapshot_observed_at":"2026-07-03T10:58:02.509388Z","title":"Inverse dynamics pretraining learns good representations for multitask imitation","venue":null,"work_id":"74e796c7-7d21-4ce8-9e42-a26e641370eb","year":2023},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2305.16985","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:3099d71af16318067572acc2b2b5456802268b698dacfa2fa7f0face130d0e2f","observation_id":"48d3a3fe-bb8c-4cc7-995c-80e64dc98969","resolution":{"observed_at":"2026-07-03T10:58:02.510712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.977553Z","title":"Evaluating real- world robot manipulation policies in simulation","venue":null,"work_id":"18890a7e-bf1b-4339-abd5-69d545173e1a","year":2024},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:08c73eab125838780984ff4b82a004d8c75949d6fb4b3f0585008c3e8ab90c70","observation_id":"20ec5fe0-10e1-494b-a2dd-b5b41f10690f","resolution":{"observed_at":"2026-07-05T09:10:52.979262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":"2405.14093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-07-04T13:49:52.027583Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","venue":"cs.RO","work_id":"9492fb3d-d667-4892-81bb-b2878f12ff0c","year":2024},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:9b086660b8c73b27fdd8bb70ae447946d82cd66abca7a4cd30aeeb634307abce","observation_id":"690ea3c9-8f41-4c4e-b5a7-0b724c3ef0fe","resolution":{"observed_at":"2026-07-03T10:58:02.513213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19012","doi":"10.48550/arxiv.2509.19012","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pure vision language action (vla) models: A comprehensive survey.arXiv preprint arXiv:2509.19012","venue":"ArXiv.org","work_id":"8b1ae741-24d6-418e-8e4d-3c7c5fd88b92","year":2025},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:8f84e2aacf409ed69e25e6acb70659be0c9ea75fae8948a10c1b5bc34e9f6a59","observation_id":"8fd5f786-5dd5-4799-ae46-c9761bfdda5f","resolution":{"observed_at":"2026-07-03T10:58:02.500160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"cited_work":{"arxiv_id":"2507.01925","doi":"10.48550/arxiv.2507.01925","metadata_source":"pith","pith_arxiv_id":"2507.01925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","venue":"cs.RO","work_id":"c1359daa-6e63-4d55-9d22-1575acbd787c","year":2025},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2507.01925","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:2beeac3aea587fd77eb3e1c225d096f377b6948c6cc8567983c56a696ed31d56","observation_id":"0acc1898-0fbd-4f36-90f3-b44d3d9f1f79","resolution":{"observed_at":"2026-07-03T10:58:02.508234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2023.xix.025","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":null,"work_id":"659dc47f-4ba2-43a2-9839-898f038dd21c","year":2023},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:b8040efa933dd10167532a2a4e48e0eb049605c161f8e71567e47fd026343989","observation_id":"d2de898d-547a-42b1-b299-5205c9e5018e","resolution":{"observed_at":"2026-07-03T10:58:02.130697Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:00.992019+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:00.992019+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.994374Z","title":"Tran, Radu Soricut, Anikait Singh, Jaspiar Singh, Pierre Sermanet, Pannag R","venue":null,"work_id":"c95e77c2-0abb-45ed-bf52-30771252bf4a","year":2023},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:4dea83837f95423b71722f6f788a50eca97bb4a25c4f3475018ed877d4573d8f","observation_id":"eca24cf8-1413-4969-9f21-8e6ab9b5430b","resolution":{"observed_at":"2026-07-05T09:10:52.995592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2024.xx.120","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://doi.org/10.15607/RSS.2024.XX.120","venue":null,"work_id":"975b2832-68f4-4b30-83de-f9cae34622a3","year":2024},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:eb9a57381d53887e457510d4efb3d6715685a1bbb458a579a1e1013eecf87e49","observation_id":"31ea9439-1ea8-4cef-81c1-0f114ee115e1","resolution":{"observed_at":"2026-07-03T10:58:02.120379Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T05:49:52.851821+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T05:49:52.851821+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.990514Z","title":"Gen-0: Embodied foundation models that scale with physical interaction","venue":null,"work_id":"9b7f2a8f-f015-443f-985e-d41d424e2a08","year":null},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:77956eddedb66e476c33d541e98411072decec60cf3bc3d4b275bf20d44d86f9","observation_id":"88560526-795d-4cae-9c97-4d920d5ecbc3","resolution":{"observed_at":"2026-07-05T09:10:52.991883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.992449Z","title":null,"venue":null,"work_id":"61054976-4a70-4196-9b42-20cedc9e8ca0","year":null},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:2c31bb7fe8a6493cb68e3fea04901d638a2a05ccbe4a1e1453eee383b7e16ede","observation_id":"6bc1b38f-693c-43bb-824a-d4ae86a8bec2","resolution":{"observed_at":"2026-07-05T09:10:52.993569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23763","doi":"10.48550/arxiv.2510.23763","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Roboomni: Proactive robot manipulation in omni-modal context","venue":"arXiv (Cornell University)","work_id":"47f52452-902c-4af4-b639-92e5f1cf2e54","year":2025},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:e3ec62487b68dbba87ec28b75eb415fa1c497560412dfe8bdfce66e7a8b4a402","observation_id":"0440ca14-471b-4339-8345-58d6953b5f77","resolution":{"observed_at":"2026-07-03T10:58:02.497295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.104154","doi":"10.1016/j.cose.2024.104154","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MIDAS: multi-layered attack detection architecture with decision optimisation","venue":"Computers & Security","work_id":"e6228ce1-3aea-4cc1-960b-b36c0c72a552","year":2025},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:4e13d6050fedbc1749ad2fb6a5a5b5a4bd5a275f4cb95fcc3a8f46a265ed9ba1","observation_id":"a482c9ee-a53c-4756-8af1-24a95959a6d3","resolution":{"observed_at":"2026-07-03T10:58:02.137297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.988578Z","title":"SMART : self- supervised multi-task pretraining with control transformers","venue":null,"work_id":"a6a1900d-875e-43f0-94fc-8c13ddfde295","year":2023},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:c3be804d845ba4ffad0bff1444cd7e38d7be3ea8b95f0eec0c25a7c0855c22c6","observation_id":"cd6c5a72-a0f0-43a4-9439-6a1ccf3d5742","resolution":{"observed_at":"2026-07-05T09:10:52.989948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5552.2023","doi":"10.1109/iros55552.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Privacy-preserving and uncertainty-aware federated trajectory prediction for connected autonomous vehicles","venue":null,"work_id":"e3ea83f4-6a6a-4996-a31d-5b52a1fcfe0c","year":2023},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:1f21c09ac5b63666bd8409eff8091563a5ee7bac693b432278687fee8523658f","observation_id":"c8656967-4d7c-4a68-a430-a24aab93f18b","resolution":{"observed_at":"2026-07-03T10:58:02.124467Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5552.2023","doi":"10.1109/iros55552.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Privacy-preserving and uncertainty-aware federated trajectory prediction for connected autonomous vehicles","venue":null,"work_id":"e3ea83f4-6a6a-4996-a31d-5b52a1fcfe0c","year":2023},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:a7554160535273a88a7e49e17a26ab7f921d49c7607987d7f2c98222b83fffa2","observation_id":"3cbd713f-13f2-4303-8b50-39a8d184b4b5","resolution":{"observed_at":"2026-07-03T10:58:02.134401Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.986393Z","title":"Masked autoencoding for scalable and generalizable de- cision making","venue":null,"work_id":"603a169d-65dd-4276-9a3b-0653601eb27f","year":2022},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:cbeef280c963bc88cfd28eeb0c934e9f90028eb44110fe4819cc7f12dd522d49","observation_id":"fe7e1554-9ba7-4048-a0fc-42836ff16b90","resolution":{"observed_at":"2026-07-05T09:10:52.987980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.981692Z","title":"Video pretraining (VPT): learning to act by watching unlabeled online videos","venue":null,"work_id":"55db151c-24ba-41f8-bfa0-c931cdad9a6a","year":2022},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:6e34b26b13db07eb40758092beb8f6cf91ba3c23b576cbdac7871e9574dd90a6","observation_id":"7795681a-09ff-4959-b472-9b13ec17cfc9","resolution":{"observed_at":"2026-07-05T09:10:52.983185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.984088Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation","venue":null,"work_id":"65646a23-7e55-485c-8380-2d52d9bf86c5","year":2024},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:1725af433b0fd92bbd1caeec0c43540bcf18c72702decb278cd5aad692795c50","observation_id":"e60d19fc-c38c-4bfd-93d9-b29d4e80fd38","resolution":{"observed_at":"2026-07-05T09:10:52.985713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2504.19854","doi":"10.48550/arxiv.2504.19854","metadata_source":"pith","pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","venue":"cs.RO","work_id":"1e89a464-b414-4d5c-a974-b2cb8be33053","year":2025},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:f81c7de24e444d13b107c8cb2846c558428802271dbda07f2fba05156ada49fb","observation_id":"2b9f8c38-d63e-4b49-8ea8-f5d147f3c99f","resolution":{"observed_at":"2026-07-03T10:58:02.505208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2504.19854","doi":"10.48550/arxiv.2504.19854","metadata_source":"pith","pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","venue":"cs.RO","work_id":"1e89a464-b414-4d5c-a974-b2cb8be33053","year":2025},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:f69a6d3c2aa4f28896db80bdf2034b814164c7690776b396ed52734d39860bb8","observation_id":"b5906c43-1ed6-49ee-8303-af2c2b4cb9f1","resolution":{"observed_at":"2026-07-03T10:58:02.127825Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.979834Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"093542fa-8483-460d-89bb-7375ead6fd6d","year":2017},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:3a393d852680577361c340395d940d4b76593a804daa7c84d8c4a7245c94800b","observation_id":"7e0a22f8-d870-4d4a-a9fe-6b14516cc6f1","resolution":{"observed_at":"2026-07-05T09:10:52.981107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21230","last_updated":"2025-07-02T15:03:26Z","snapshot_observed_at":"2026-07-06T21:47:58.024273Z","submitted_at":"2025-06-26T13:20:55Z","title":"World-aware Planning Narratives Enhance Large Vision-Language Model Planner","version":2},"cited_work":{"arxiv_id":"2506.21230","doi":"10.48550/arxiv.2506.21230","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21230","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World- aware planning narratives enhance large vision-language model planner","venue":"ArXiv.org","work_id":"67a8356e-6e7a-4ee3-b20b-524132d69ae8","year":2025},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2506.21230","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:17aa091adcb41c42aebd6a03eadd3ddf8a8cabcccc2ca8a7ea3c0d783736a995","observation_id":"f2ebcc77-e075-441f-89db-9aeb21e22657","resolution":{"observed_at":"2026-07-03T10:58:02.520601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-10T12:47:05.553101Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","venue":"cs.RO","work_id":"e35c8c6d-977d-4af1-963a-766ba98703ce","year":2025},"citing_paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-03T10:54:16.265155Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2607.02466"},"observation_digest":"sha256:7f044a3d7842e07c00cb46e7c7d726537802652be06c35416f0cb8c809b72ab4","observation_id":"ab655980-ea2d-4bc7-ad9f-d4f6095bc54d","resolution":{"observed_at":"2026-07-03T10:58:02.503326Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.02466","last_updated":"2026-07-02T17:33:37Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T02:38:14.363010Z","submitted_at":"2026-07-02T17:33:37Z","title":"Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":1,"verified_exact":13,"verified_fuzzy":14},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.02466."}