{"as_of":"2026-08-04T21:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:291415030616c58ff515b23561c063bb446754042a7f9a0e5171d4eb596371c9","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T06:57:41.245418Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.30484/citation-record","integrity":"/paper/2605.30484/integrity","json":"/paper/2605.30484/citation-record.json","paper":"/paper/2605.30484"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-11T00:07:42.794081Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:7489d17737416edc127c8578698480d2b5fc19a63f5f5a431b78cc54292da1d6","observation_id":"3a8e9379-29ed-43c6-9d35-55d9ab1aeeaf","resolution":{"observed_at":"2026-06-29T07:23:13.424661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Zitkovich, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:54b9727bbe3e3dc7199c42b493823cae3ba4f8adeb3f0fe7d0b821cd0a71e7c7","observation_id":"ab59accb-ee9e-4d3a-aaac-bb9615769fe0","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T00:07:42.817654Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:03ead8888a959bf45d41ea355221906711c10dd21f502b96fb1c3da2a484726d","observation_id":"21a57737-eb94-423d-b2b2-a6955a61f3f3","resolution":{"observed_at":"2026-06-29T07:13:17.510036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:74bf391b1bc7fc0be5fda57019e98366310c4bc670b6f1c767b1431648802f5b","observation_id":"545999c7-668f-4603-8276-97cf60d35c42","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-10T23:37:42.946293Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:571e7dee3d75da4c230e3a043aa619730694492648db3a2b2afe90f4076da590","observation_id":"27fdd501-f986-4147-818f-58bdd8880993","resolution":{"observed_at":"2026-06-29T07:13:17.496721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"cited_work":{"arxiv_id":"2507.01925","doi":"10.48550/arxiv.2507.01925","metadata_source":"pith","pith_arxiv_id":"2507.01925","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","venue":"cs.RO","work_id":"c1359daa-6e63-4d55-9d22-1575acbd787c","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2507.01925","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:4a7588b9cd6edfe61755fd84b6259766ae7a20dd206c3342200409e10cabf74e","observation_id":"84ea24f8-9965-4174-b68b-defd8d53c585","resolution":{"observed_at":"2026-06-29T07:13:17.488295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.15201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:23:13.401852Z","title":"arXiv preprint arXiv:2508.15201 (2025) 2, 3","venue":null,"work_id":"ac7a32f7-0d08-458f-93a8-ecc7d56b0c15","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:e575cb92ff12c568fc83cb119686dff1ee1002264d609864acd1d3acbd656b8f","observation_id":"f16121df-3b90-4ba4-ac1c-fa0a36c0d3ec","resolution":{"observed_at":"2026-06-29T07:23:13.403517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":"2506.21539","doi":"10.48550/arxiv.2506.21539","metadata_source":"pith","pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-07-10T23:37:42.965894Z","title":"WorldVLA: Towards Autoregressive Action World Model","venue":"cs.RO","work_id":"d8c0c873-b2fc-44a5-a0c8-0d4a698783fb","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:bd41e3855b8a843e9bd75b307f7726fdf43577ba379bbaff90f292c0a8d2e754","observation_id":"0876f9d3-7865-42b7-8bf7-60cc745d1ea6","resolution":{"observed_at":"2026-06-29T07:23:13.428145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:9a00a7f6e8cf5789afa89adb9fcdc7845ce03aba875e15aeb9a7fffd66bc04e5","observation_id":"8d8ceccc-0615-417f-a1d4-dbc5bb0f1cfe","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:e1833644d1203778402a5159100f8405913f0f27f04be5ce7fa09f1ceb4b7b74","observation_id":"2118b63d-d334-499a-ae1d-ad4abab4ed05","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-10T12:47:05.553101Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","venue":"cs.RO","work_id":"e35c8c6d-977d-4af1-963a-766ba98703ce","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:a39abf01339adec1a8dcceed5ced9cd8a579a6e70db244e3612437162c37a8a0","observation_id":"7def37d1-8786-40d1-b7eb-e85b64f9d1da","resolution":{"observed_at":"2026-06-29T07:13:15.303922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-10T23:17:45.135806Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:9a2f1ed231e71c7ae83db7505996dddd7a58c07f0f42d45caebcde053a2bc053","observation_id":"c0453ade-dafa-4db6-9556-4366af89d4e4","resolution":{"observed_at":"2026-06-29T07:23:13.406462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16811","last_updated":"2026-04-07T13:11:17Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:51:42Z","title":"GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation","version":2},"cited_work":{"arxiv_id":"2512.16811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.16811","snapshot_observed_at":"2026-07-09T20:16:29.403258Z","title":"GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation","venue":"cs.CV","work_id":"4e0b601f-16b5-488d-8c8a-70ef8daec6e8","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2512.16811","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:d8a3487e91ad0f07a8b9a57f07d1fb65a3504d5a40772876f8e5a1b813706830","observation_id":"02ba9f7f-6e1c-4007-84c9-68078d19dfad","resolution":{"observed_at":"2026-06-29T07:13:15.285400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.635572Z","title":"Pri4R: Learning world dynamics for vision-language- action models with privileged 4D representation","venue":null,"work_id":"c5dd7a3d-0471-4a23-82c2-41c5b0964258","year":2026},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:ecbaa9a47f1c37598cf474d348a9fe761be1c55ef5ab46433803fe2091177af4","observation_id":"52148d5a-246f-420b-8674-4920eca59f64","resolution":{"observed_at":"2026-06-29T07:23:13.406669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:18815c5c562cc497028049f5fabc33655f1666e28af44d686c0bb1f8f086b982","observation_id":"17699890-ccf7-4150-aead-f0d2b2c46ee6","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Zhang, X","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:23b02efb84f346c6d03014437bcb236bfa84ec3d515aee0bd3029cb70d265a55","observation_id":"999a3690-f64b-40ee-bd4b-936e4c56a90c","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-07-06T21:33:07.415628Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"cited_work":{"arxiv_id":"2505.23705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23705","snapshot_observed_at":"2026-07-10T23:07:48.099929Z","title":"Knowledge insulat- ing vision-language-action models: Train fast, run fast, generalize better","venue":"cs.LG","work_id":"0cb59615-1c1f-41a5-a1cf-4ecf8e6a0aa6","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2505.23705","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:a330f82c098bae002adee5bbddec3d6ccac98f8f541571bf39e7906d76f00d64","observation_id":"ac8ef37a-5616-4f89-a3f3-647130ecc193","resolution":{"observed_at":"2026-06-29T07:23:13.460726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:98935714a732c4a2dc7b72cd8bf53ecef741493e0a275b77b64f88a6ff236c5e","observation_id":"239b5947-7d16-4332-9dfc-45969cf39cc7","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:e97eae57fb1337b0e75db43ff895ad972400a2708de4800eec1679b0739f6032","observation_id":"fcf143fa-0900-404a-9580-e8edf49f22ff","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Black, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:223ef81851c17d3631f36346d4708a05685ecae57ec3602ed7581c3726fbd308","observation_id":"07c2368d-c58a-4093-88a8-a9ffe0dabbed","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":"2505.06111","doi":"10.48550/arxiv.2505.06111","metadata_source":"pith","pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-07-10T23:37:43.249067Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","venue":"cs.RO","work_id":"e05d654d-db73-48f6-9318-381b6798bac9","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:f29b696ce2e140fe1bd17d5e6d0f71a7a105f4a24a31900bb63ef92e2ab546de","observation_id":"d55c2170-ae38-4339-987e-d02e09cb8384","resolution":{"observed_at":"2026-06-29T07:23:13.452157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-07-06T21:44:42.748650Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:1a51f9e0824eb4fcc95a784bb73370c1ec93400e7050a328facdf67fddcae66a","observation_id":"ed470334-f0ba-422c-922a-939f8f57033f","resolution":{"observed_at":"2026-06-29T07:23:13.455458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12369","last_updated":"2026-06-01T11:34:15Z","snapshot_observed_at":"2026-08-02T11:53:05.192943Z","submitted_at":"2026-05-12T16:38:40Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","version":2},"cited_work":{"arxiv_id":"2605.12369","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12369","snapshot_observed_at":"2026-06-29T07:23:13.398570Z","title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","venue":"cs.RO","work_id":"85923d25-9652-4581-ade9-8efc9fa558ab","year":2026},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2605.12369","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:bd0070607e2215dbae6b5dbf9a44f7a06f3a6214651a70cc0cad8fcdffad4244","observation_id":"ca51edbe-f8d4-4f05-ba83-c7afb2962e2e","resolution":{"observed_at":"2026-06-29T07:23:13.400609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:e67147d437706f571e8d78977235468f3be75b52c8582cda5e0fd73ce07ad965","observation_id":"ee6ee7c5-5573-4fac-b8cf-95fbdf01f655","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.07961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:30:00.489574Z","title":"Bridgevla: Input-output alignment for efficient 3d manipulation learning with vision-language models","venue":null,"work_id":"2cc19a78-3f94-4f0d-a6d5-3a516a9770e2","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:6489e612f5ee12b81aefb55ac456d4f12f9871927e7bc665b70598328bd8e671","observation_id":"ac3d55ed-b353-468c-9d25-a19c9e2ec840","resolution":{"observed_at":"2026-06-29T07:23:13.413700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00807","last_updated":"2026-05-14T15:06:31Z","snapshot_observed_at":"2026-07-06T22:43:55.785732Z","submitted_at":"2026-01-31T16:34:52Z","title":"Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds","version":2},"cited_work":{"arxiv_id":"2602.00807","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00807","snapshot_observed_at":"2026-07-01T23:06:20.353270Z","title":"Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds","venue":"cs.CV","work_id":"607efef7-b902-4d30-923c-a717a9d70625","year":2026},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2602.00807","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:7bdf9c2590457f1229971f810321adcf8f72e77ae504015716961387df6ada3e","observation_id":"3e72a74d-0a48-4c7c-9f4f-faf9a2d25f2c","resolution":{"observed_at":"2026-06-29T07:23:13.410205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:e0ff95c8e8cc46ef87964ab6bce479224c22d2545a11b2821cd950ac3bd83796","observation_id":"fcefb056-7979-4a75-803f-743a52e37b69","resolution":{"observed_at":"2026-06-29T07:13:15.299659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-07-06T22:11:52.522787Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:91722ec61132b16574f718821ca28dde27c1ba15b217a580caa7c6f2e636d636","observation_id":"cdff4942-d152-4ee1-bdc1-672ff08d89e0","resolution":{"observed_at":"2026-06-29T07:13:15.294796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Hafner, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:fbeee03cbd4798ab155727dd5183b86748d949ea228cbb9c01c775fa1e64415c","observation_id":"cf5a7cc7-5f0f-4482-944b-aac076b5fffd","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T11:18:03.332897Z","title":null,"venue":null,"work_id":"83b667b7-cebc-4e2d-b583-3bc93189c531","year":2026},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:9107177d39cbc77428db67dfcfa74c38e0a6fc45cb93e7b00a11767679eaff3d","observation_id":"a9a23350-22a2-47f4-b621-ba4392f5f3e0","resolution":{"observed_at":"2026-06-29T07:23:13.416874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15212","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:39:46.280004Z","title":"RynnVLA-001: Using human demonstrations to improve robot manipulation","venue":null,"work_id":"50d73fe4-0fa1-43bc-ac8e-e05dc7f9a1d7","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:316a5280509ab296dba63373c721eca59141054cdbfc2487ef891aef581cd3b4","observation_id":"934b6d37-44ed-41e6-b6b3-4ac968fda543","resolution":{"observed_at":"2026-06-29T07:13:15.280679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.15882","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:13:15.287837Z","title":"Future-vla: Forecasting unified trajectories under real-time execution","venue":null,"work_id":"ed3a618d-7e82-4615-80c1-402a6b2bee11","year":2026},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:591b0ac87664b6f664da62792ed6c9a20b662e072e69d6b5bf7a57eb8280c291","observation_id":"dc2acd90-2c5e-4445-856a-1b493b740a06","resolution":{"observed_at":"2026-06-29T07:13:15.290287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Hafner, K.-H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:ec80d78507be506bda24a32b6fe82c42b971fc5f49646e46fb4683c26e7fd641","observation_id":"e877ff04-d980-4780-bf6e-338aa9aca5ff","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13633","last_updated":"2026-04-15T09:01:20Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:01:20Z","title":"ESCAPE: Episodic Spatial Memory and Adaptive Execution Policy for Long-Horizon Mobile Manipulation","version":1},"cited_work":{"arxiv_id":"2604.13633","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13633","snapshot_observed_at":"2026-06-29T07:13:17.512228Z","title":"ESCAPE: Episodic Spatial Memory and Adaptive Execution Policy for Long-Horizon Mobile Manipulation","venue":"cs.CV","work_id":"54df5f68-d99a-4f52-9664-659db07b130b","year":2026},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2604.13633","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:6500643cf7c4ae023047e06ec769edba8e5a237ff604352fea16e2cf275e4354","observation_id":"4b2d96da-86e3-4f22-b331-1548ea78116f","resolution":{"observed_at":"2026-06-29T07:13:17.514599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:bc7d49039c849130263b64ba4938f5dc0025b3143619edcbe14d1dda36f5c9e0","observation_id":"bf888299-d27f-47a6-9162-1ea1feff61d6","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Black, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:5bc9b6233790a139d50c22aa22b1cbc14b19f3c3daf7e06c8fac5a0f929310eb","observation_id":"ff195861-e928-44d6-bd8f-2962215c9512","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Beyer, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:7eb29a4791e53ae5dd2256f9787c9a61b6701a46e2d3d83a06fc9f9f014c41b7","observation_id":"fc98eaf4-eba6-41da-bfd3-b01a33420674","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:79040a73cfee108d5fb9b1852c310094b3b84d6cabca20d21db3d253161e49b3","observation_id":"e969e05a-b001-4b14-81ba-c8bdfd817bf0","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:ff719e5b440b4cb4a989d26b242f62030711d6489f08135c6dfa7101fd0ed9cb","observation_id":"28b86fe6-ea34-411f-a396-f1dd652ff6db","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2505.17016","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-07-04T20:50:12.325218Z","title":"Interactive Post-Training for Vision-Language-Action Models","venue":"cs.LG","work_id":"1ad0b2af-71bb-415b-b955-e3350f1a1ae8","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:94191a3191a3b089a3cc3fe631794a1c4e57d6ed988741e66a3727d9e74e3c65","observation_id":"044c476d-446e-4dbd-9c74-11b1d1275c56","resolution":{"observed_at":"2026-06-29T07:13:17.500860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:59:55.366158Z","title":"Expertise need not monopolize: Action-specialized mixture of experts for vision-language-action learning","venue":null,"work_id":"3a623ec8-362d-4909-bf0b-47c0a3fc9191","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:98e0915b08342dec5cb07a2b6447b80a9a2d96f8933b8626c07183a01e401654","observation_id":"deab1789-0ab2-47c2-b09f-24ae8dee1387","resolution":{"observed_at":"2026-06-29T07:13:17.505411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09372","doi":"10.48550/arxiv.2509.09372","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Vla-adapter: An effective paradigm 10 for tiny-scale vision-language-action model","venue":null,"work_id":"3a5ccb46-7c4b-4722-a692-4da07c94d2b1","year":2025},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:84ecf2346b521a42cd5e19495a8096bcea7986a001eb4a4a154f8f866f5432ab","observation_id":"c97d09a0-281a-4a55-beb1-60fd838f4eef","resolution":{"observed_at":"2026-06-29T07:13:17.492054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T06:57:41.245418Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T06:57:41.245418Z"},"links":{"citing_paper":"/paper/2605.30484"},"observation_digest":"sha256:eefbf4357900e38183e0d862bf4e590d5f599177d71d54a7f087d9074ea7886d","observation_id":"eb7dcb81-97f8-4ed2-ba72-d527e47e0fae","resolution":{"observed_at":"2026-06-29T06:57:41.245418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.30484","last_updated":"2026-05-28T19:03:30Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T15:34:13.108251Z","submitted_at":"2026-05-28T19:03:30Z","title":"ELAN4D: Embodiment-Centric 4D Supervision for Vision-Language-Action Models via Plug-and-Play Adaptation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":25,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2605.30484."}