{"as_of":"2026-08-06T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c023a6fd77251d4c34266f1b1f6ab2394a78d4ab2ab7082ed3b5f0164a1c548","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T21:37:50.617813Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:38:18.585964Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T05:36:01.252344Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T06:12:19.643111Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2501.15830"},"observation_digest":"sha256:32e39d5213c6137e5b4e2d8e1350e231f1a240bc2d5d8643e9e05cf9a2231827","observation_id":"6f02b858-b7d1-47a3-81c8-de4291621983","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:a48e6ba3ba474f9da0a3caa6783bc1bb2c9d05f2f861bc63005cbc52f7a5c5ad","observation_id":"3e5c5f32-e6a1-4867-b353-6c4259945e00","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T15:28:06.883492Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2505.06111"},"observation_digest":"sha256:e3c552b0f3f51e3ee3ecb90d4d1da95a88de30586c0163674607b15bce3ad079","observation_id":"b2d9fe60-5df8-4a13-999d-af208700494e","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2505.17015","last_updated":"2026-05-22T13:26:59Z","snapshot_observed_at":"2026-08-02T12:28:29.672279Z","submitted_at":"2025-05-22T17:59:39Z","title":"Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T08:38:02.944230Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2505.17015"},"observation_digest":"sha256:8b82a80859883b6b857c70a578fc23f5955c3f4466fb02bd499602c6e266d90c","observation_id":"14a5a2ee-4f77-46f6-a14f-3c287f392eb1","resolution":{"observed_at":"2026-05-25T08:40:32.989611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:ea62343a732918b0763d31dd883f8c946bba334bbd59c0d5cc29ec4c07b34434","observation_id":"e5560d0c-f671-43d8-b56b-f9f4c0d786df","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-06T19:38:18.585964Z","title":"Towards generalist robot policies: What matters in building vision-language- action models.arXiv preprint arXiv:2412.14058, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05116","last_updated":"2026-07-08T17:09:24Z","snapshot_observed_at":"2026-08-06T19:29:40.498273Z","submitted_at":"2025-07-07T15:30:55Z","title":"VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:18.585964Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2507.05116"},"observation_digest":"sha256:6c62c3d309cbf931031db22993550328683ea774ce56cf5abed3d39b4a2e7d15","observation_id":"b7e28558-4f5c-4ce8-8fc0-60800e645546","resolution":{"observed_at":"2026-08-06T19:38:18.585964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:c93d7a6fd0a3849f76c9d461d974eb5f80d6c6a069dfd98f60f9b9fe49e8b558","observation_id":"aa552093-d4af-4d3e-82ba-3b401294b059","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T21:52:02.893886Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2507.23682"},"observation_digest":"sha256:a26f6eecbf30845b7b54df3aa59a566a3cc2a9a9c17b2aae646c68a0d3abf89c","observation_id":"c6f04bca-d4aa-40e5-bc1a-5929e0aaff62","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-05T16:55:52.186146Z","title":"Towards generalist robot policies: What matters in building vision-language-action models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17449","last_updated":"2025-09-04T16:46:34Z","snapshot_observed_at":"2026-08-05T16:55:50.271610Z","submitted_at":"2025-08-24T17:01:15Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:52.186146Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2508.17449"},"observation_digest":"sha256:167639bb0f9b7707807681f7fbb1d4b76e1082bc27e97f7395e6bb3768c81ad4","observation_id":"941c0693-7845-4c8e-900e-1492f4a0ccc8","resolution":{"observed_at":"2026-08-05T16:55:52.186146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-05T15:26:40.661829Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19958","last_updated":"2025-08-28T10:13:01Z","snapshot_observed_at":"2026-08-06T11:55:27.946631Z","submitted_at":"2025-08-27T15:12:03Z","title":"Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T15:26:40.661829Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2508.19958"},"observation_digest":"sha256:e890ad38c8fdc7d61e3572ac02b8fcc80747abb8279a468cef75c851bbf86664","observation_id":"05320bbe-34ca-4a1e-a85c-b9294b827571","resolution":{"observed_at":"2026-08-05T15:26:40.661829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-05T05:48:46.550293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-08-05T05:48:44.865688Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T05:48:46.550293Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2509.04996"},"observation_digest":"sha256:af77191408ac590c2422e20d23ebe259745318377a81ffd1821e59d9026e2e8f","observation_id":"a9002ed8-887a-49fa-9d4f-fdc60d2ae041","resolution":{"observed_at":"2026-08-05T05:48:46.550293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-04T22:55:29.925406Z","title":"Towards generalist robot policies: What matters in building vision-language-action models.arXiv preprint arXiv:2412.14058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-04T22:55:29.306356Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.925406Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:3e23e13672833a01829069aade466627f079660516ee8f7e9ab1363cd77694b9","observation_id":"6887cc6b-0618-4f86-a323-39a4b08a9c20","resolution":{"observed_at":"2026-08-04T22:55:29.925406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-04T20:10:13.532490Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08820","last_updated":"2025-09-10T17:52:09Z","snapshot_observed_at":"2026-08-04T20:10:11.887304Z","submitted_at":"2025-09-10T17:52:09Z","title":"RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:10:13.532490Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2509.08820"},"observation_digest":"sha256:9ba0a308657cedaed63d44641059cbc2758f133ae7f97960ba557624d14ec39d","observation_id":"ad47c271-72d7-4eb1-b772-2be9468b1762","resolution":{"observed_at":"2026-08-04T20:10:13.532490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-04T12:54:49.747548Z","title":"Towards generalist robot policies: What matters in building vision-language-action models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01642","last_updated":"2026-07-07T04:25:23Z","snapshot_observed_at":"2026-08-04T12:54:45.972724Z","submitted_at":"2025-10-02T03:48:07Z","title":"FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T12:54:49.747548Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2510.01642"},"observation_digest":"sha256:7ac5ede371160fc38b719d1f30b6389fe8ebccafef91330cd729ff35ddfd2918","observation_id":"43c0e31a-92c7-4be8-ac5a-6b9597484dea","resolution":{"observed_at":"2026-08-04T12:54:49.747548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-04T09:34:43.447966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-05T03:01:04.996856Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T09:34:43.447966Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2510.14836"},"observation_digest":"sha256:d1a18e95750c057f1edcf477947549d616713fae1e4c5b501a02e2c9616de80a","observation_id":"ae57cef9-d09c-4f3a-a437-919db1abb4e4","resolution":{"observed_at":"2026-08-04T09:34:43.447966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T21:28:18.630934Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2511.14148"},"observation_digest":"sha256:0e855ef34652927bcaa51ea1821dd132ebdf431122bdd209bf680c8b92830d9b","observation_id":"bfca82c3-030d-4500-ba8d-b02ce8fcf60f","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2512.09928","last_updated":"2026-04-09T17:02:58Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-10T18:59:32Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T23:01:13.910539Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2512.09928"},"observation_digest":"sha256:139bd23b4f97a3faf8ce81b8f764b7f8c3f2b7a480e2320656c36af5341ca46f","observation_id":"0823ed07-a098-43fd-bb65-84a784894e10","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-03T12:30:33.830536Z","title":"Towards generalist robot policies: What matters in building vision-language-action models.arXiv preprint arXiv:2412.14058,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T12:30:33.830536Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2601.03309"},"observation_digest":"sha256:79ec624d4c86fc2767a5d97178bdecbce2277e0e6c8af68c717e0760195efc37","observation_id":"6a301265-94fd-406f-b8c2-9b42cef5380c","resolution":{"observed_at":"2026-08-03T12:30:33.830536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-03T00:02:13.372878Z","title":"Towards generalist robot policies: What matters in building vision-language-action models.arXiv preprint arXiv:2412.14058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.11934","last_updated":"2026-06-08T09:01:34Z","snapshot_observed_at":"2026-08-04T13:02:28.723589Z","submitted_at":"2026-02-12T13:30:24Z","title":"Robot-DIFT: Correspondence-Sensitive Diffusion Features for Contact-Rich Robot Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:13.372878Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2602.11934"},"observation_digest":"sha256:6dbc786442eaa5615a712fdbdfef93fd4d43a9e1dc3f83a378d6e9e3fac93efe","observation_id":"17df520a-3ab1-4f7b-8b08-0b58539720cf","resolution":{"observed_at":"2026-08-03T00:02:13.372878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2602.20323","last_updated":"2026-05-03T05:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-23T20:18:35Z","title":"PhysMem: Scaling Test-Time Memory for Embodied Physical Reasoning","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T20:05:30.324309Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2602.20323"},"observation_digest":"sha256:26f90de1309bfb1f7e9081142588ddbf2659f75e79c1504655f4a443184e05f2","observation_id":"bde4c1cf-9f0f-45c3-a83d-eca0a94d1a50","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-02T21:12:12.842554Z","title":"Towards generalist robot policies: What matters in building vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21013","last_updated":"2026-05-29T17:02:38Z","snapshot_observed_at":"2026-08-02T21:12:09.620600Z","submitted_at":"2026-02-24T15:30:55Z","title":"Notes-to-Self: Scratchpad Augmented VLAs for Memory Dependent Manipulation Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:12:12.842554Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2602.21013"},"observation_digest":"sha256:0b8dc928cd4711f0578bd15df075075b0b9f796b26af3872e515a6b88e17a40c","observation_id":"3ada60f4-cda7-444f-9bde-9c004195bb68","resolution":{"observed_at":"2026-08-02T21:12:12.842554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-02T20:18:04.939146Z","title":"Towards generalist robot policies: What matters in building vision-language-action models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23721","last_updated":"2026-06-30T14:23:11Z","snapshot_observed_at":"2026-08-05T22:50:17.159050Z","submitted_at":"2026-02-27T06:43:37Z","title":"StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:18:04.939146Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2602.23721"},"observation_digest":"sha256:22a2a3ce0488ea6ffa1aa6cfed932dc3ff337fa571e08bfdea7813ea58cb9fd6","observation_id":"87aaae01-72b2-4596-833b-9378e6f387a7","resolution":{"observed_at":"2026-08-02T20:18:04.939146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2604.03181","last_updated":"2026-04-03T16:57:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T16:57:06Z","title":"Multi-View Video Diffusion Policy: A 3D Spatio-Temporal-Aware Video Action Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T18:54:07.081457Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2604.03181"},"observation_digest":"sha256:7fcd24ec38f65032913c492ff216aa8258d69fade0c50953177621a7a27c426a","observation_id":"54a2240a-1abb-4040-8116-622980df07a2","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2604.05672","last_updated":"2026-04-15T03:34:03Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T10:18:40Z","title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:23.255452Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2604.05672"},"observation_digest":"sha256:9e408fbb65c0918d6539f4932436b2c2746ea9354f2d08807ef2803714eece90","observation_id":"76a9d1ea-a4be-41d3-9f12-e9bd4cee6c22","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2604.20100","last_updated":"2026-04-23T04:10:40Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-22T01:51:48Z","title":"JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T01:05:49.874253Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2604.20100"},"observation_digest":"sha256:5a155eaea150a93a8a0abfa139fa157e786267f992eb1eb712d0829a02aa1f42","observation_id":"27b6b2fc-8d27-4e7d-a3c6-33eed07672a0","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2604.20348","last_updated":"2026-06-10T16:25:38Z","snapshot_observed_at":"2026-07-31T07:57:35.750469Z","submitted_at":"2026-04-22T08:51:07Z","title":"Bimanual Robot Manipulation via Multi-Agent In-Context Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T00:25:24.362191Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2604.20348"},"observation_digest":"sha256:3745d7be38b34911c5fcccb48fcfa5188d5546b6f0e193202059719a1887a4ea","observation_id":"32ca6a19-7b21-40a5-9197-1f9b20191251","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2605.06175","last_updated":"2026-05-08T06:32:29Z","snapshot_observed_at":"2026-08-06T12:57:32.760363Z","submitted_at":"2026-05-07T12:56:58Z","title":"VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T09:11:21.715023Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.06175"},"observation_digest":"sha256:cd45f6276b74097301cfb5239c1fe1f95635c3faa625028be228b54bf6c3323a","observation_id":"86bfb119-9e23-4e0e-8518-b0d0aa742974","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2605.06175","last_updated":"2026-05-08T06:32:29Z","snapshot_observed_at":"2026-08-06T12:57:32.760363Z","submitted_at":"2026-05-07T12:56:58Z","title":"VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T01:05:07.509291Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.06175"},"observation_digest":"sha256:c0c20f1e95cf44596ed84f4890db4b6c00f020e8528a636f84f7e517dbacfb10","observation_id":"909513c3-68d7-4d84-a971-79577968e705","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2605.09537","last_updated":"2026-05-10T13:49:56Z","snapshot_observed_at":"2026-08-02T15:18:58.596973Z","submitted_at":"2026-05-10T13:49:56Z","title":"Drift is a Sampling Error: SNR-Aware Power Distributions for Long-Horizon Robotic Planning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:15:19.347519Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.09537"},"observation_digest":"sha256:3058d2cbb36db49d69a59a46877454f5d36e3d2ae4274304238bf86f84c86894","observation_id":"737b6042-96ad-4d5f-bfa9-86e7651e7b7b","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2605.12167","last_updated":"2026-05-12T14:15:16Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:15:16Z","title":"From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.661688Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.12167"},"observation_digest":"sha256:5b41c493b1aa9b93ba878b398b7c014f077c59fdabc452158335c6d6a295407e","observation_id":"5a725cd6-4940-4c71-a2f7-9ca3778c0476","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2605.13403","last_updated":"2026-05-13T11:58:02Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T11:58:02Z","title":"RotVLA: Rotational Latent Action for Vision-Language-Action Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T17:48:06.734816Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.13403"},"observation_digest":"sha256:7a8d698584707acf930cd3adfafb8b15173b073669a9b512a412bf3b1862ef24","observation_id":"8c45d145-87a7-47b6-a5fe-19764a7312ed","resolution":{"observed_at":"2026-05-17T21:37:50.975242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2605.14712","last_updated":"2026-07-11T13:09:54Z","snapshot_observed_at":"2026-07-16T23:17:51.777870Z","submitted_at":"2026-05-14T11:31:02Z","title":"IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T20:55:56.318157Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.14712"},"observation_digest":"sha256:8bdc8509ddb44315b8e6572b26a01551dfae13564a8ebb9b922e2d82d0d1bad1","observation_id":"c4008f89-b3fa-4021-b7c3-d0a3999d9938","resolution":{"observed_at":"2026-07-01T14:35:46.750240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-14T18:59:49.358909Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.14712","last_updated":"2026-07-11T13:09:54Z","snapshot_observed_at":"2026-07-16T23:17:51.777870Z","submitted_at":"2026-05-14T11:31:02Z","title":"IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T18:59:49.358909Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.14712"},"observation_digest":"sha256:37ce4db605a988447c8fd2c3ff52e405d1dcb1a2e9b708bbdbba7bf46b2622f8","observation_id":"9fdcabab-c52d-45b7-8230-af335289e687","resolution":{"observed_at":"2026-07-14T18:59:49.358909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2605.15298","last_updated":"2026-05-14T18:11:47Z","snapshot_observed_at":"2026-08-02T19:33:56.173371Z","submitted_at":"2026-05-14T18:11:47Z","title":"PhysBrain 1.0 Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T16:34:44.204055Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.15298"},"observation_digest":"sha256:46c87a3cd9566aa52b09f1946290ca2701912ead315e7251616cd99c0ad452b2","observation_id":"1ba6987e-b015-410e-a7b4-6cb70b030d51","resolution":{"observed_at":"2026-05-19T16:37:39.950177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2605.25829","last_updated":"2026-05-25T13:28:33Z","snapshot_observed_at":"2026-08-02T07:58:35.491806Z","submitted_at":"2026-05-25T13:28:33Z","title":"OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T21:27:26.682689Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.25829"},"observation_digest":"sha256:c6a282c36d93d8a61e241a239bd906077187ae422e3f590039deb6cca0e057d1","observation_id":"5fa77bc2-1fb2-489a-96f9-3d1cca4507bf","resolution":{"observed_at":"2026-06-29T21:33:59.329882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2605.28083","last_updated":"2026-05-27T07:38:16Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T07:38:16Z","title":"VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T12:59:17.093731Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2605.28083"},"observation_digest":"sha256:3a791dab562430d8e54ea040e51a42744d302a6aa31eb2934af8dc34dc9caae6","observation_id":"33aced77-c7df-4dee-bb7d-8c91acfe6590","resolution":{"observed_at":"2026-06-29T13:03:26.136063Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2606.00110","last_updated":"2026-05-27T03:38:15Z","snapshot_observed_at":"2026-08-01T20:24:07.703181Z","submitted_at":"2026-05-27T03:38:15Z","title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-06-29T13:33:03.368006Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2606.00110"},"observation_digest":"sha256:d302f4c7a77e9221aa8e6866b66874f8471ece6110c2a25ec26250da406f1215","observation_id":"76a1b0c9-b239-4667-8ca3-67eb07f8b574","resolution":{"observed_at":"2026-06-29T13:33:27.784888Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2606.03127","last_updated":"2026-06-02T04:10:39Z","snapshot_observed_at":"2026-07-06T23:43:27.226603Z","submitted_at":"2026-06-02T04:10:39Z","title":"TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T10:09:08.056968Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2606.03127"},"observation_digest":"sha256:e6c695b77d0fb37029997b3eb2070b836f314d5d11fc2bedbb49e3dd36209bbe","observation_id":"ed99c49c-fc2a-4b33-86ad-b7653c49ee90","resolution":{"observed_at":"2026-07-02T03:26:28.502942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2606.04436","last_updated":"2026-06-03T04:34:07Z","snapshot_observed_at":"2026-08-02T19:43:14.201593Z","submitted_at":"2026-06-03T04:34:07Z","title":"3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T07:20:40.998337Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2606.04436"},"observation_digest":"sha256:64df70bd338eaee515b467ce5ad237fba517949fe59d32de872610c8ff6d8231","observation_id":"dfd867b6-7c44-4bfd-888d-9ad0abaf0381","resolution":{"observed_at":"2026-07-02T06:36:44.041558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T22:25:17.522240Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:5c54ba0e39aeaaf721b4dfb7f0c4247751aa485306814e65550b2de29f88aa72","observation_id":"aedf29e1-5680-4cfa-a61e-0f673e20da5b","resolution":{"observed_at":"2026-07-02T16:47:09.496354Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-01T07:17:42.045939Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:cd0bd3732d6e0cd87bd1c287e4192dd95892684effc8169e12cf2346bae2edde","observation_id":"1fe5ca7b-9480-4b7b-ad3c-be6f2500dcbc","resolution":{"observed_at":"2026-07-01T08:35:34.440088Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2606.10267","last_updated":"2026-06-09T00:24:00Z","snapshot_observed_at":"2026-08-03T01:41:20.917317Z","submitted_at":"2026-06-09T00:24:00Z","title":"What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T13:36:56.552395Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2606.10267"},"observation_digest":"sha256:1da279fa90d089ff989b3ec50594b3a731e8f07ace130baaf8a9a5305ac824db","observation_id":"8380a49b-2ac3-4eea-a7bd-13f20dfd7dfe","resolution":{"observed_at":"2026-07-03T04:47:38.576010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2606.10568","last_updated":"2026-06-09T08:31:59Z","snapshot_observed_at":"2026-07-06T23:49:47.137691Z","submitted_at":"2026-06-09T08:31:59Z","title":"VeriSpace: Spatially Grounded Action Verification for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T12:47:35.314486Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2606.10568"},"observation_digest":"sha256:ec77efde074f6b118447b2def73c168da72c95f9b3595fc64c375aab17eb2389","observation_id":"92c15b20-0b1d-4bff-b1a3-7b61a365a99d","resolution":{"observed_at":"2026-07-03T06:17:41.790875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2606.23565","last_updated":"2026-06-22T16:31:48Z","snapshot_observed_at":"2026-08-03T00:44:37.135935Z","submitted_at":"2026-06-22T16:31:48Z","title":"HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T08:27:15.889885Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2606.23565"},"observation_digest":"sha256:5fcea8e9e15ae9834ee96cc465a87c4f008c05d306b4e0db866dd371450fdb50","observation_id":"9891ac9f-4a8e-4538-86fe-69fe07102273","resolution":{"observed_at":"2026-07-04T10:49:46.505486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":"2412.14058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-07-09T05:36:01.252344Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","venue":"cs.RO","work_id":"972ba6c7-a312-404e-bd8d-851850b28fc9","year":2024},"citing_paper":{"arxiv_id":"2607.07608","last_updated":"2026-07-08T16:26:06Z","snapshot_observed_at":"2026-07-11T23:20:16.411671Z","submitted_at":"2026-07-08T16:26:06Z","title":"Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T05:29:36.753268Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2607.07608"},"observation_digest":"sha256:45bcfc9ae32a486514e9099850dbaf3e77dace7390db9600d0beac2821226674","observation_id":"0dde5dc2-ca81-465d-b62b-251bf7a85223","resolution":{"observed_at":"2026-07-09T05:36:01.254012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-02T00:04:04.138071Z","title":"Towards generalist robot policies: What matters in building vision-language-action models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-06T10:19:48.881664Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.138071Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:3fa25a77149bb7ef1c920bb5c05927a985aca50eb7b160d8ce8169d64fe11c0f","observation_id":"9dc5e2df-7a63-44a3-9226-42faad756336","resolution":{"observed_at":"2026-08-02T00:04:04.138071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-01T14:39:44.845464Z","title":"arXiv preprint arXiv:2412.14058 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-04T15:25:40.989347Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:44.845464Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:01bd42eeaeef23867b0868512e8f912d1d0a5fa5fd144207f6e7732f74931cb1","observation_id":"2b2bb9c8-09c2-484a-9e7b-208f63fd66f2","resolution":{"observed_at":"2026-08-01T14:39:44.845464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-01T14:14:43.293927Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26513","last_updated":"2026-07-29T06:24:25Z","snapshot_observed_at":"2026-08-06T11:55:25.265414Z","submitted_at":"2026-07-29T06:24:25Z","title":"Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T14:14:43.293927Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2607.26513"},"observation_digest":"sha256:26aac36b989c4c5de21e1753ce35401e7e56282827db30761ad4fc19e423d7ba","observation_id":"8c5727ca-8a7d-4120-8242-c4e4033704a9","resolution":{"observed_at":"2026-08-01T14:14:43.293927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14058/citation-record","integrity":"/paper/2412.14058/integrity","json":"/paper/2412.14058/citation-record.json","paper":"/paper/2412.14058"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"abe0dc9d-38b0-4f78-87e4-1f56476c29c8","year":2022},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:f865408eddf43c44d14b5d7aaffb17107975f31042acee60309d790f86ca66b6","observation_id":"9f43182c-4218-4708-81e3-a183d7ba0b05","resolution":{"observed_at":"2026-05-17T21:37:50.961534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:71aee5ceb3dcc7d1f967e269ff6348444be8643da5b6645dbb77ed29a81793da","observation_id":"6327640b-6520-4734-9dcb-076e52bd1caa","resolution":{"observed_at":"2026-05-17T21:37:50.668786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:7da5ef458e74686a8665faef4906c98d6cf1239dfa6850fc259d4813185aa5df","observation_id":"d2b49e18-aab9-46ff-9f7e-53173b115b85","resolution":{"observed_at":"2026-05-17T21:37:50.676778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:c1b78f158647bd8e2c240ad12a61a92cd45bb788369a6ebbf1b873e1a0fb97d1","observation_id":"bcb6b6ea-2692-4ab3-9e0e-7092a78ef483","resolution":{"observed_at":"2026-05-17T21:37:50.683754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11706","last_updated":"2023-12-22T13:55:42Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:35:20Z","title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2306.11706","doi":"10.48550/arxiv.2306.11706","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.11706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robocat: A self-improving foundation agent for robotic manipulation","venue":"arXiv (Cornell University)","work_id":"143e7731-0488-4088-8e23-63f9d4140118","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2306.11706","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:98a66321e15bc6d169ea030bc40b68addc5ac120734f280cd043f72b206fa54c","observation_id":"5b4e2902-16db-4ccf-a9b8-c08bcffd4191","resolution":{"observed_at":"2026-05-17T21:37:50.692026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:2f12cd7491aa980066c57ce45a3e07b73ff5572cd1f3f3cfcb92f07c1b14ce85","observation_id":"0205a320-063b-4fa4-a7bf-8f828a9ac790","resolution":{"observed_at":"2026-05-17T21:37:50.700111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:a50dbc6f0429a9737389333a73454a025c8e17b6dba3397cb90fbee7552c5066","observation_id":"8f70d6d8-e7a0-4264-823a-6d06bd4319d0","resolution":{"observed_at":"2026-05-17T21:37:50.706165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:30a2ef8e6c84f37c53b856acb33f9ba7cd3ec878d40f67544c0a17984cb55579","observation_id":"9418149c-13e5-4fdc-84d4-6477d619c478","resolution":{"observed_at":"2026-05-17T21:37:50.712601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"8d3517d4-ba69-4deb-8b5f-43c1a97b4ae7","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:56649f60734f705ac198eb48d8021812bd29cabab857aa55c7f3b7dde2f442c9","observation_id":"6bede542-7190-4ddd-980e-1361f1aaf294","resolution":{"observed_at":"2026-05-17T21:37:50.867856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-03T11:40:51.182181Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":"1412.3555","doi":"10.1145/2939672.2939875","metadata_source":"pith","pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","venue":"cs.NE","work_id":"c7f2f5a9-ae4b-48db-aff0-24b9d0528995","year":2014},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:08df77f3e17a80dffee46a129fd65970578513b1d64e5405ee5d591a5fdcf3ff","observation_id":"5c1194ee-339c-4ccb-8aac-2e6e19e9d6db","resolution":{"observed_at":"2026-05-17T21:37:50.828876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-19T20:22:37.170537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T20:22:37.170537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:0076553bff1c4af53407604d91d311a8716811192532b0a72c167069b5add89a","observation_id":"1be9bf5b-b4c3-48c8-a1f7-7f4725d8ecee","resolution":{"observed_at":"2026-05-17T21:37:50.833067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":"9fc617c7-a1d5-4eb9-9785-d1aeb462a5a8","year":2017},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:bd7b436d026f89aa794b18b92d9f23e93c13a6d1423fb1e96f5c3c3e44afa1f7","observation_id":"2bb8beeb-d451-4af2-9fbb-94ce424e233a","resolution":{"observed_at":"2026-05-17T21:37:50.903103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-3: Its nature, scope, limits, and consequences","venue":null,"work_id":"8129de0b-670f-4197-a13b-0aac495c3a8b","year":2020},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:83655a18c613e3b5ab96fb854225878ee61bee310e0e0d456ee1ee2277601588","observation_id":"84705487-e9db-481b-96a7-2f4d9c1ba5d4","resolution":{"observed_at":"2026-05-17T21:37:50.910214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long short-term memory","venue":null,"work_id":"dc3d43b6-7a32-42ef-bd0e-8e6397b83c10","year":2012},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:7a86256882c1d7f972a4d17dcb19e2607dc930599d5a75ba4208d970c3f9bb1e","observation_id":"ec2dab5e-509a-47da-9237-afa7bfcc9518","resolution":{"observed_at":"2026-05-17T21:37:50.917436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:b5e8bd163c23add5f0fd718349fd0700ba77c6d74b434f84ed3427dcbc0fc62f","observation_id":"1bff4d0c-4c89-49f2-abc0-fa8959b304d5","resolution":{"observed_at":"2026-05-17T21:37:50.837969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":"66107698-db3a-4818-bcd5-0cb52db059e4","year":2021},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:c690a732e250a2c419a9379cd0a56aa136888d84da06bbe071738585ee4da31c","observation_id":"e78c6868-9ab3-415c-8280-acc279f32aec","resolution":{"observed_at":"2026-05-17T21:37:50.928095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":"a62cbb6e-6217-4f46-a099-69da39cc0f84","year":2022},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:5cfeccc019a33f42d737e4c3a98e279bda16566848b9005ae9e99fc403292ab0","observation_id":"b6e94f44-696c-491b-9efe-f8a7f1ee7f22","resolution":{"observed_at":"2026-05-17T21:37:50.934432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-06T18:16:44.186935Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2210.03094","doi":"10.48550/arxiv.2210.03094","metadata_source":"pith","pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jiang, A","venue":"cs.RO","work_id":"7b5f6cce-bbaa-40ed-8b09-7330832dd736","year":2022},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:af3303fb89962f27f0dcf25851c5be928c5737ae10a8f3f13f4a843fce901919","observation_id":"cf67eb99-1617-40ce-a7c2-52496ef7c858","resolution":{"observed_at":"2026-05-17T21:37:50.842888Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":"2402.10885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-07-10T14:37:15.931790Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","venue":"cs.RO","work_id":"68b58508-d209-4c82-b5da-88ed1178eaaa","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:14c04ac1c6854afbd1804602538a2ede16c0c6db28da4e9caa2c607d6492ff62","observation_id":"d55420aa-f5ab-40ef-8bfb-b696c5d40ff1","resolution":{"observed_at":"2026-05-17T22:00:05.246520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:c92567ded2434acd9425aabf4deb15436735c45bbe62413f4dec4c1abd9b8a88","observation_id":"042a928e-46ca-4f70-822b-68c8bad0a779","resolution":{"observed_at":"2026-05-17T21:37:50.861026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14368","last_updated":"2024-12-23T14:08:16Z","snapshot_observed_at":"2026-08-02T19:49:36.255279Z","submitted_at":"2024-08-26T15:46:41Z","title":"GR-MG: Leveraging Partially Annotated Data via Multi-Modal Goal-Conditioned Policy","version":2},"cited_work":{"arxiv_id":"2408.14368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.14368","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"URL https://arxiv.org/abs/ 2408.14368","venue":null,"work_id":"67fd88e3-e121-4423-86a1-e5c13fd9f9a6","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2408.14368","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:de2810a7bfddcad4f1a04f7ec6f654bb4cb80cc0106368ee0cd6f7155ef2efc9","observation_id":"df37c3b8-5d67-4673-8bb0-e408b0af1b93","resolution":{"observed_at":"2026-05-17T21:37:50.720922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:382b11864220c8a7954b9c435bddbd921804185faf8188f06ef5be21f257cf8a","observation_id":"3a307198-f89e-4159-b195-7ec5d128335b","resolution":{"observed_at":"2026-05-17T21:37:50.726848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":"2405.05941","doi":"10.48550/arxiv.2405.05941","metadata_source":"pith","pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","venue":"cs.RO","work_id":"7f4ca6cb-1b94-454c-9623-b52441b74b61","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:09c16f4ef142bd6896113be95815b2eb720f66b89d00ed20127c1eca2420a964","observation_id":"0b081c3b-5c2f-46de-a2e5-e7d32ea62e91","resolution":{"observed_at":"2026-05-17T21:37:50.732573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:f5f0b0f5fe03c30c8c381f2086ca2504a0a4eb8a05d413b1723de9c96d2fc5b0","observation_id":"3ed40d69-2c67-4419-8d4b-30fa59529416","resolution":{"observed_at":"2026-05-17T21:37:50.739139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18977","last_updated":"2024-09-12T03:24:58Z","snapshot_observed_at":"2026-07-06T18:37:47.471616Z","submitted_at":"2024-06-27T08:13:33Z","title":"RoboUniView: Visual-Language Model with Unified View Representation for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2406.18977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18977","snapshot_observed_at":"2026-07-03T11:48:04.895968Z","title":"Robouniview: Visual-language model with unified view representation for robotic manipulaiton","venue":null,"work_id":"8b54fef9-2376-4785-a768-e6a663456618","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2406.18977","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:ffab749118a6707bb343bba2f50637799976ef923a87de38776e2e7c2bdca99c","observation_id":"02893c26-0624-4d53-828b-b8e2cadf64bc","resolution":{"observed_at":"2026-05-17T21:37:50.745251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"a2628f23-eb28-4e09-a098-bce23f22dee1","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:96b1a05e6bb081a9a67033be2570e760b31abda9dacd3bc86618931903ade7cb","observation_id":"3b7fd351-9604-4a32-b8fd-48b7d726c916","resolution":{"observed_at":"2026-05-17T21:37:50.967725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodied intelligence: A synergy of morphology, action, perception and learning","venue":null,"work_id":"0afb6149-42f4-4351-959e-6b68733a78b7","year":2025},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:af82dffb1e39f95c48ce679e8f642c3df86ce9c28925b39dc2299e9150d00933","observation_id":"3886197b-86db-422c-aa03-5c4ff445cc46","resolution":{"observed_at":"2026-05-17T21:37:50.970968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-06T21:10:19.901649Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":"2406.04339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-07-01T15:05:47.993970Z","title":"arXiv preprint arXiv:2406.04339 (2024)","venue":null,"work_id":"bd66dd10-c6c9-4fb4-99ef-3dac1fa2b937","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:9a1ee6fe5cfd82df81475f46d1eaa218c8b40915806d1251ec2895904c92ef9b","observation_id":"290b5786-1f73-4067-a976-d11cdcb7f124","resolution":{"observed_at":"2026-05-17T21:37:50.751231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recurrent neural networks","venue":null,"work_id":"bb24e0eb-5120-4761-a469-f6d820cd6014","year":2001},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:70e8b14ba0ddb4ca70c5160ee6887f948d8e40d2b8dde83448d276ab0ca37f7b","observation_id":"1edfb71d-d626-4eaa-8ad5-5afc19a43340","resolution":{"observed_at":"2026-05-17T21:37:50.880492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks","venue":null,"work_id":"176950b7-b928-45fc-bcbe-577179478d17","year":2022},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:bd8bc7896c71a8426281374ddc7e81686d565b8f1f15b5f1490dd63d04a0baf8","observation_id":"aac55734-6788-43db-aa99-6dd726fbc1bb","resolution":{"observed_at":"2026-05-17T21:37:50.890282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"5dcb223e-90c8-4124-b744-05796a4ef219","year":2021},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:1930b9305343c495347b6bb145e6c8c633e3907eaa3c7520684cf906244a2849","observation_id":"877634e0-c398-45ea-bd70-ae617c33e6f8","resolution":{"observed_at":"2026-05-17T21:37:50.921133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2203.12601","doi":"10.48550/arxiv.2203.12601","metadata_source":"pith","pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":"cs.RO","work_id":"1fb6c1b7-913d-4a89-bbad-842fdb5fca1d","year":2022},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:5be5862b8356639dcd740f149135186613d07e46553525a73ecccef37aaaf4a0","observation_id":"c37c1c17-84f1-47af-b705-f85104062e88","resolution":{"observed_at":"2026-05-17T21:37:50.756429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:277fcf62b4f7accce700531b80faff754f937b833b7f3d16fa469ac7e6491edc","observation_id":"cc30b2aa-16b7-48f4-800c-82aa1ba557b4","resolution":{"observed_at":"2026-05-17T21:37:50.763828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:7cbd018e148e036da772da2b65ff2c9ea2c14875afa485b8c7c290ff4ffdea22","observation_id":"9919b5a0-4dbd-4ad9-9e9f-be9110487b93","resolution":{"observed_at":"2026-05-17T21:37:50.769303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":"ec9e431f-922d-43d2-94a2-72361e5cb387","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:5a1c9c8152471a488dc07b55c098e21a942256a9bc691c4317a75f189d3c9fbc","observation_id":"b33b9288-af0f-45a5-a5e7-5f48c27ddbdb","resolution":{"observed_at":"2026-05-17T21:37:50.951449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":"2205.06175","doi":"10.48550/arxiv.2205.06175","metadata_source":"pith","pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Generalist Agent","venue":"cs.AI","work_id":"4b0a87cd-8d54-4abc-9698-c4cb20995600","year":2022},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:fdc1ab0d046d8adcdabb09fc94a32ccfd7b0075b42d1df81344db77154dde08f","observation_id":"e91eae74-9107-415f-8f31-3356a00f644b","resolution":{"observed_at":"2026-05-17T21:37:50.774708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"673648be-3a3e-4e3a-ab5e-f8bd0e89ef1c","year":2017},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:423b5018fb103fb7ef70abbca8e13cb0f2ad0dbee8b1687bbaff107219b7d712","observation_id":"345cdf66-8b1d-49ad-bb48-0028d7eba8e1","resolution":{"observed_at":"2026-05-17T21:37:50.958151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:ffe6256d1b3c4e5bcf1421be01def2da8a540db92a69a657387b65fe41aa4ab7","observation_id":"288a73e2-40a5-425a-a837-c0f7d44d0638","resolution":{"observed_at":"2026-05-17T21:37:50.779214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03949","last_updated":"2024-11-24T02:02:33Z","snapshot_observed_at":"2026-07-06T17:40:37.837709Z","submitted_at":"2024-03-06T18:55:36Z","title":"Reconciling Reality through Simulation: A Real-to-Sim-to-Real Approach for Robust Manipulation","version":3},"cited_work":{"arxiv_id":"2403.03949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03949","snapshot_observed_at":"2026-07-04T17:29:59.793610Z","title":"Rec- onciling reality through simulation: A real-to-sim-to- real approach for robust manipulation","venue":null,"work_id":"d4ee5882-8029-4561-8cd0-42735b06fb84","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2403.03949","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:ab4f6c658885821f56e992a69b9390b86e8f22076175afa09340012063640ef6","observation_id":"53be6ba4-0d61-4c3e-81dd-6bd5782e8c53","resolution":{"observed_at":"2026-05-17T21:37:50.784456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uform: Pocket-sized multimodal ai for content understanding and generation","venue":null,"work_id":"3312c23f-f68d-4520-a04a-bf0e3d6dbada","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:74977363a3445e84ac9ad88e3fb2e7e68491ffe98b2887a5376ada0600f993d4","observation_id":"de5219c6-f0ea-4710-8d13-ef8de3f2de45","resolution":{"observed_at":"2026-05-17T21:37:50.974261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"b4782f68-187e-4909-83d5-8f2de6fc91c0","year":2017},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:e15431711e3519e91257568d2df4e6a30532f11dcbaeb710ee7156e93229ffb0","observation_id":"dca11815-5cef-4c2a-8bf5-6bd5aea0f969","resolution":{"observed_at":"2026-05-17T21:37:50.940877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moondream, tiny vision language model","venue":null,"work_id":"4110039b-6175-40e7-ae77-29d230f298dd","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:59f8e260942d4ff90ae3733fe4b18b5234faaf5409b35435d3c5a21f5472ebeb","observation_id":"450d7ae3-4b84-4d3d-b226-755bdec2009b","resolution":{"observed_at":"2026-05-17T21:37:50.944398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"2b91be1b-cb0f-4e93-81ab-a268119ce598","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:a826d8dd905a17ff26c42ed8a930f552e1677d84e948532765fef187a2a06eb9","observation_id":"11ef8a8c-0395-4273-b77e-63458688bd34","resolution":{"observed_at":"2026-05-17T21:37:50.947933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"1b1e1f88-b071-4f7f-930d-9f75fd8c6fea","year":2022},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:86726f0b86e4fd80100b8a66a9648c5833deb98098573ccd17cbe9b152be7803","observation_id":"3680f861-18c4-4642-a5d4-6e6b6f7a5924","resolution":{"observed_at":"2026-05-17T21:37:50.954947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2312.13139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-07-04T21:00:09.556391Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","venue":"cs.RO","work_id":"e92c2c13-4330-45fe-8231-34a6002626bd","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:3af183130fd29dec05bc11084d1b11b34e0ee6ca2e8cf7d57984a29304a5c304","observation_id":"45b2bbee-8bf4-46c8-a56c-125019b862e6","resolution":{"observed_at":"2026-05-17T21:37:50.789922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09996","last_updated":"2021-09-30T22:43:19Z","snapshot_observed_at":"2026-08-05T01:07:28.059139Z","submitted_at":"2021-05-20T19:13:27Z","title":"VLM: Task-agnostic Video-Language Model Pre-training for Video Understanding","version":3},"cited_work":{"arxiv_id":"2105.09996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.09996","snapshot_observed_at":"2026-07-04T06:09:37.771946Z","title":"Vlm: Task-agnostic video-language model pre-training for video understanding","venue":null,"work_id":"ec798446-5b15-4737-a20f-01a3d0662f91","year":2021},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2105.09996","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:4e41b0afbad4c97ce5ff7c356bed2b2f36b40547382d986fdec45dd68fb4fdcf","observation_id":"2f274156-4873-4ef9-ab0f-4a87e6bc7137","resolution":{"observed_at":"2026-05-17T21:37:50.795057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":"2309.17421","doi":"10.48550/arxiv.2309.17421","metadata_source":"pith","pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","venue":"cs.CV","work_id":"344e9dbe-1d9b-4992-a4f1-9bc649978f46","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:ee9639f1018558c89e92a369e3e1f2a73ea865fc5578bfc17ab4ef55582e40ea","observation_id":"affd3e59-1ee0-4735-8917-06ed7dde6ea3","resolution":{"observed_at":"2026-05-17T21:37:50.799854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:197c8ae4d5bc5e4b03e0222e92b27005082e1d3e74aec2d60db37ac255e50cc8","observation_id":"4b663d66-8493-4372-a97a-1ac02bb8f69b","resolution":{"observed_at":"2026-05-17T21:37:50.804809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02359","last_updated":"2024-11-04T18:26:08Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T18:26:08Z","title":"DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution","version":1},"cited_work":{"arxiv_id":"2411.02359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02359","snapshot_observed_at":"2026-07-08T01:44:26.118057Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution","venue":"cs.RO","work_id":"eaa5003c-8fc8-4134-badf-23c33ae3764c","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2411.02359","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:cefcaa1d7a77112f4c16382260958a04aa78d6d4d168f404ece8f655aa367fee","observation_id":"6b7cc466-0404-408a-9c6b-c4427ec8cb95","resolution":{"observed_at":"2026-05-17T21:37:50.810099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-07-06T18:44:57.578408Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":"2407.08693","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-07-10T13:37:06.920040Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","venue":"cs.RO","work_id":"bbe96698-686e-4b4a-9f7f-ed5054e61cca","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:73ce6cf8e73d108ce973a76daddea6c15432a95c88b1d1f5d84872415ca34bc4","observation_id":"9f20cad6-497c-44f3-a411-8e205100dd2a","resolution":{"observed_at":"2026-05-17T21:37:50.814685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:0a3249f9efccaae7fd573c06ba38e597e27dafbc3c7d7904c8aa7eb37b886b07","observation_id":"26e200d2-dd94-4409-b05e-db71f1772e7a","resolution":{"observed_at":"2026-05-17T21:37:50.819324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sim-to-real transfer in deep reinforcement learning for robotics: a survey","venue":null,"work_id":"893ee083-e1bc-4476-96c5-6d4b5edd5444","year":2020},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:141c61ecf39a97f52674e1fdda7b2cb6c28a5d7b355b056a0a8dad1f18720141","observation_id":"a0045528-21f9-42a5-af08-787fab6777af","resolution":{"observed_at":"2026-05-17T21:37:50.964769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:547a6bab64f1ea1c162a20841e1700860dc78b5a4f67c911a72db42b469a6049","observation_id":"5a3c3806-e811-4803-a045-c40be984e3f8","resolution":{"observed_at":"2026-05-17T21:37:50.824010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-07-06T21:31:54.566899Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":"2505.21906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-07-04T10:49:46.316884Z","title":"Vision-language-action model with open-world embodied reasoning from pretrained knowledge","venue":null,"work_id":"8090c765-4caf-40ba-abeb-8304bb07eda5","year":2025},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:4f657604dbd37824568aa19f8be7d107a569d0d403246cbad7f3628fd9ab3a0a","observation_id":"7b90b889-cb7a-4be7-bbaf-b74925dd9442","resolution":{"observed_at":"2026-05-17T21:37:50.657904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","latest_version":4,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":30,"verified_fuzzy":20},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 48 inbound Pith citation observations for arXiv:2412.14058."}