{"as_of":"2026-08-06T21:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b57350ebdf8e8a5d4725e0be82da770c664bbce9f71f92f0eaf38d5b03cb5ee","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:53:07.734871Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:04:08.886475Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T07:04:20.747493Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"cited_work":{"arxiv_id":"2606.00054","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.00054","snapshot_observed_at":"2026-06-30T07:04:20.747493Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","venue":"cs.RO","work_id":"ecbcbf65-0b4f-47fb-965b-4594c21714ef","year":2026},"citing_paper":{"arxiv_id":"2606.29517","last_updated":"2026-06-28T17:27:23Z","snapshot_observed_at":"2026-08-04T07:35:13.260869Z","submitted_at":"2026-06-28T17:27:23Z","title":"CORE: Common Outcome Regularities from Action-Free Visual Demonstrations for Robot Manipulation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-30T07:04:08.886475Z"},"links":{"cited_paper":"/paper/2606.00054","citing_paper":"/paper/2606.29517"},"observation_digest":"sha256:f3266058f6e9cbc3422a3b8e65890f79d03a361f01806d3f915df9ce9f7bcee5","observation_id":"f856e00c-ec8c-4ffe-a690-6a5d236da996","resolution":{"observed_at":"2026-06-30T07:04:20.748949Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.00054/citation-record","integrity":"/paper/2606.00054/integrity","json":"/paper/2606.00054/citation-record.json","paper":"/paper/2606.00054"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:29b778ec5188e89d2eeb9396faa856a91872105bcacc0b7caef7fa1c3210e00e","observation_id":"18ac73da-f463-4ba2-a28b-c89268783562","resolution":{"observed_at":"2026-06-30T18:55:00.198844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.672325Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelli- gent embodied systems.IROS, pages 3549–3556, 2025","venue":null,"work_id":"9b554ed8-11f4-4676-8574-75379a61d0f3","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:2735587b3d1def07850abd05efa1a8b2555beb380e0a3438da627786036a813a","observation_id":"9c938cc1-a1f6-4d36-a5e9-f11b48349e71","resolution":{"observed_at":"2026-07-08T02:34:27.673530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.670708Z","title":"Egocentric-100k, 2025","venue":null,"work_id":"7a26356a-9ec3-490f-8683-075c0f04986e","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:6a17b4de0f9c7ddfcca32ac3a9336bdd6926231b2420ad1bc12cb370198e72b7","observation_id":"20361032-6f3a-4fff-ae6d-c9dacb06e552","resolution":{"observed_at":"2026-07-08T02:34:27.671801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.663400Z","title":"Affordances from human videos as a versatile representation for robotics","venue":null,"work_id":"d7de8713-0c7c-41fd-9184-6c7fe45ba4ab","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:aae5ec5b847e00d109c524b044adc7fe0dda1d0f67447b9d662f09a3dcfe7b08","observation_id":"0bbf8ae7-e72c-46b3-8cf3-7e13617476d2","resolution":{"observed_at":"2026-07-08T02:34:27.664883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.659853Z","title":"Hot3d: Hand and object tracking in 3d from egocentric multi-view videos","venue":null,"work_id":"78627a44-a8d8-41ea-a601-479638c294f4","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:b985ce4a77c316a0848c5131a396e21d4248717dee9d210eb50a1a2baefacc79","observation_id":"3df0448e-7df1-4993-b5db-1d90f923dae2","resolution":{"observed_at":"2026-07-08T02:34:27.661120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.686743Z","title":"Gen2act: Human video generation in novel scenarios en- ables generalizable robot manipulation","venue":null,"work_id":"67c4f713-4585-4cfc-907b-e8b79a9adaca","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:b74d79eb2e3e862b119cfa477495df7cd9c1844f17cbe57639196e3aaa12495f","observation_id":"7e79e161-99d4-404f-b8f2-91e9bace544c","resolution":{"observed_at":"2026-07-08T02:34:27.687973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":"2512.13030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-07-10T04:16:48.690751Z","title":"Motus: A Unified Latent Action World Model","venue":"cs.CV","work_id":"d0b2d257-524d-4d67-9daf-5fb43e5e977a","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:cc62f6bed0b087cc932ed4f133408eb73b9d4eedcf82c0c67f20a1eb3af49b8b","observation_id":"e1bd363c-1639-456f-9ae9-a333752b12a8","resolution":{"observed_at":"2026-06-30T18:55:00.177500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23523","last_updated":"2025-08-01T06:30:43Z","snapshot_observed_at":"2026-08-06T10:47:54.256882Z","submitted_at":"2025-07-31T13:06:59Z","title":"H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2507.23523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.23523","snapshot_observed_at":"2026-07-10T18:47:31.665247Z","title":"H-rdt: Human manipulation enhanced bimanual robotic manipulation","venue":"cs.RO","work_id":"eed69612-81a9-49c8-811f-3696bfe4037c","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2507.23523","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:d91362ad882e14318388af47541d0a9f5137579887197e573f3b57ec78175283","observation_id":"bb8bf0e5-db77-432b-9b84-dd01ba1ba51a","resolution":{"observed_at":"2026-06-30T18:55:00.204443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:9be4082a5edc50f4f559154b647d2af220bea18c701da45793c34e4b866e16d5","observation_id":"38512e7b-48d3-4151-b281-913c2531b82d","resolution":{"observed_at":"2026-06-30T18:55:00.207724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:7ab20620061160d85f1ad76ee98921158a29ab25e03486bfd58ed8c999806398","observation_id":"eedcf644-ffc9-421d-be6c-e7b478a662dd","resolution":{"observed_at":"2026-06-30T18:55:00.191452Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.681498Z","title":"Scaling robot policy learning via zero-shot labeling with foundation models","venue":null,"work_id":"dd11beaf-9ad9-4e44-80cf-3b6b3b04fedc","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:2bc9e67f31709a7030ae71bd04cfdc380e9742d8fe6d570d3d36868bf44a83e7","observation_id":"f4c6c7a4-7e1d-4452-8b76-239ee9134886","resolution":{"observed_at":"2026-07-08T02:34:27.682644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:143058b2dfe6ebd239011c5b999967a53c225bf036feb34be03d0e3c8e57e377","observation_id":"1f104c49-2d16-41d7-8e5c-ba8ee5f9b914","resolution":{"observed_at":"2026-06-30T18:55:00.174869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.674028Z","title":"Affordance learn- ing from play for sample-efficient policy learning","venue":null,"work_id":"d729bd30-0fa9-4692-a1ba-fa97b87c533f","year":2022},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:fde64eaab47d659e11037e2df284b3da6c4b1a6cd39ff9e4d1c4794106f93b19","observation_id":"ee4dedce-2e0d-4727-88ba-fb7c5f20506a","resolution":{"observed_at":"2026-07-08T02:34:27.675254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.657898Z","title":"RT-2: Vision- language-action models transfer web knowledge to robotic control","venue":null,"work_id":"4c5395a2-c1e3-4308-838d-b096ea1e76b9","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:9ec55c2a9c58e495c499e58da44e1e58218cd6eb8fcafa045c161d6f5d2c3d39","observation_id":"95238e06-8f83-4b8b-aa24-589727f1bb20","resolution":{"observed_at":"2026-07-08T02:34:27.659313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.692045Z","title":"UniVLA: Learning to act anywhere with task-centric latent actions","venue":null,"work_id":"dcf6fa60-e6d9-4913-a58e-b478f0b38d5a","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:6c2812823e056d4a4025b94f14bfb390544fddfd026919f108e8321fcf8d5af2","observation_id":"86fe84fc-bc9e-4c51-8f57-b77d256c6f0a","resolution":{"observed_at":"2026-07-08T02:34:27.693239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.650823Z","title":"In- n-on: Scaling egocentric manipulation with in-the-wild and on-task data","venue":null,"work_id":"cce6bd4b-86b8-4542-9eca-d09f4c0da1cf","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:d81fde887f169dfbb5db7db371aa9bb2c30e8f589dd301902cac57dce932b41e","observation_id":"14b53126-07ae-4fe0-bd9c-04e0f117560c","resolution":{"observed_at":"2026-06-30T18:55:00.197710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":"1907.06987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-07-04T09:49:44.399575Z","title":"A short note on the kinetics- 700 human action dataset","venue":null,"work_id":"6eaebe96-5819-4220-84d5-dd888c79b8f4","year":1907},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:d28e26c44cfe7ab9a2abaf241a7430592baad650b55b259a885fe79c9e119fec","observation_id":"4ec35ef4-52a8-49df-bd10-24eb53b1b237","resolution":{"observed_at":"2026-06-30T18:55:00.183297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:6062680879ee7f139b1ffeeecae78b02836e05bc1919235afed428891a5b47b8","observation_id":"a03b5a39-a11c-40b5-b4e8-40b8d7f9dda8","resolution":{"observed_at":"2026-06-30T18:55:00.192350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":"2411.00785","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-07-04T21:00:09.783700Z","title":"Igor: Image-goal representations are the atomic control units for foundation models in embodied ai","venue":null,"work_id":"b127536f-15a2-43f9-9edf-3ceb198ec554","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:32405f6ff76b751641e4229525c4d78a4b74e7acb7cfb3173a1d57b3be2408ee","observation_id":"172dd323-3d20-42be-9cab-eb70a0bdf684","resolution":{"observed_at":"2026-06-30T18:55:00.167016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.684931Z","title":"VidBot: Learning gen- eralizable 3D actions from in-the-wild 2D human videos","venue":null,"work_id":"4cf7961e-8761-41ea-a0ad-fab58aad36d2","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:f4313f125aee835f1624c1fc44b33c937da4be943d7bdd526ce73f902aec1105","observation_id":"feec6cc3-8c0f-4f6f-b7dc-cd8173b86ce7","resolution":{"observed_at":"2026-07-08T02:34:27.686094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:324072dd8077e0ff2d03f97833cb064c1410e6cfab0fe843d0d4e20f00725619","observation_id":"d7b2be9a-46c4-4d73-99b2-06c5560ada06","resolution":{"observed_at":"2026-06-30T18:55:00.201414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2507.23682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.23682","snapshot_observed_at":"2026-07-04T17:30:00.529444Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","venue":"cs.RO","work_id":"e4e687d7-64db-4ff4-8ddf-752b58365e0f","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2507.23682","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:1cc415f4d92865e418ca27afe8abc97e96b02ec710b528e6846c65fcb4e337d6","observation_id":"90dbf41a-e9e8-4317-af53-269b5f9365da","resolution":{"observed_at":"2026-06-30T18:55:00.193835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.683180Z","title":"Moto: Latent motion token as the bridging language for learning robot manipulation from videos","venue":null,"work_id":"e2f6274f-1909-4189-90bb-2b2d66e522c6","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:16fd6050a321a0af0cf5076a7e8d080364b5e84b9ae3a3dff16de0c41754775e","observation_id":"32eeaeb9-73b2-4fb4-a8b0-47eff7ebc859","resolution":{"observed_at":"2026-07-08T02:34:27.684391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.677924Z","title":"The EPIC- KITCHENS dataset: Collection, challenges and baselines","venue":null,"work_id":"0a3087e6-ec2f-4b6a-a69a-fb80def76b02","year":2020},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:7d80c5c67513d9b80a42b40c4b405f5d278ee65fe4fa61a5067eb49ea62f17c7","observation_id":"62cf13e8-28a2-4065-b37f-c431084ea8df","resolution":{"observed_at":"2026-07-08T02:34:27.679139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.690225Z","title":"Tam- ing transformers for high-resolution image synthesis","venue":null,"work_id":"f03cb292-9fd2-4632-9265-5924cccc4017","year":2021},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:033ade7f17fe0f0b8ced9b74e584e8f84bc74643427fc043a11f2a1ac640db4f","observation_id":"b4b0f713-14dc-4854-a954-937cfce6f683","resolution":{"observed_at":"2026-07-08T02:34:27.691478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.679713Z","title":"Arctic: A dataset for dexterous bimanual hand-object manipulation","venue":null,"work_id":"809a4146-0123-49c2-8add-7d0303fbce68","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:d69e89616948192ed1967f6a2926df7e08a92b5e8a1863f56418b3b1a611e068","observation_id":"83a00802-ea26-40a3-8241-196af6cdf826","resolution":{"observed_at":"2026-07-08T02:34:27.680903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00595","last_updated":"2023-09-26T10:47:35Z","snapshot_observed_at":"2026-07-06T15:49:23.374270Z","submitted_at":"2023-07-02T15:33:31Z","title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot","version":2},"cited_work":{"arxiv_id":"2307.00595","doi":"10.48550/arxiv.2307.00595","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.00595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RH20T: A comprehensive robotic dataset for learning diverse skills in one-shot","venue":"arXiv (Cornell University)","work_id":"d0404087-2d28-482f-8b50-8400d35d315e","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2307.00595","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:eb0fb94c04d76cefc6f06e370496102e786ddd6097df336aa9f442191a39fda2","observation_id":"8ea4912a-e097-43de-a47d-94ac4085f9f4","resolution":{"observed_at":"2026-06-30T18:55:00.172475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.668930Z","title":"Learning la- tent action world models in the wild, 2026","venue":null,"work_id":"13e0237a-7d41-4a92-b8c0-82b308510fa6","year":2026},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:fd0c37dc065820418e234ab5427f4dcef493ac4c0b41bf19c9b5b8b823162ca7","observation_id":"87c53b22-5c50-4df3-9ea4-164fc839f0cf","resolution":{"observed_at":"2026-07-08T02:34:27.670126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.662670Z","title":"The ”something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"7c99071a-ab12-4bff-a26b-a65996e3b20b","year":2017},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:a6a2c9d66a0956c2e16ee93446abbbb389a9adb4aaf4bc556d256b1edcbd9947","observation_id":"76b32393-54fb-4001-80b6-d48d4d3fbdba","resolution":{"observed_at":"2026-07-08T02:34:27.663964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.665436Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"214b0bf2-c97d-4b77-9704-6b1e7cdb8b02","year":2022},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:d60f7b4fa36b7c44b6e2a93687af54e9b3fdfc8301aaa1367183f37d062ed471","observation_id":"d988bbc4-8cf9-4c95-b5bc-8aa9c4b2336b","resolution":{"observed_at":"2026-07-08T02:34:27.666666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.688519Z","title":"Ego-Exo4D: Understanding skilled human activity from first-and third- person perspectives","venue":null,"work_id":"88ebaaf4-de74-4fc2-b79e-acfe1de75332","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:82d2bbf1ef63d6adb26d29d76491b8939ec308df4fd08c82780fcdf3a874cce7","observation_id":"5367fe3e-02a7-4d90-932d-fd08659b0f57","resolution":{"observed_at":"2026-07-08T02:34:27.689662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.675906Z","title":"Lelan: Learn- ing a language-conditioned navigation policy from in-the- wild videos","venue":null,"work_id":"1f120a66-851b-431a-bfa0-dffc7d3a262e","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:0cd07d89c738576c95d99ef4b002b5859f06c095d61e1825e12d75a30cc421e7","observation_id":"0e31e212-597f-4f5a-86a1-d13710801c66","resolution":{"observed_at":"2026-07-08T02:34:27.677342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":"2505.11709","doi":"10.48550/arxiv.2505.11709","metadata_source":"pith","pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","venue":"cs.CV","work_id":"4190fb9c-70e0-4388-aa0b-516589489047","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:1006867825f404105fde5f9fb53d7b348a35c753578befebd87d5798d8fe4516","observation_id":"144c5b1b-61f8-4315-a9b9-0348280ee8aa","resolution":{"observed_at":"2026-06-30T18:55:00.169609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.667206Z","title":"Video prediction pol- icy: A generalist robot policy with predictive visual repre- sentations","venue":null,"work_id":"48c66040-9169-4bff-a429-a8836ad12e2f","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:9abfaaf0bbe50a2fac29eea8cdf54da42059a10aa4bdf77a613a179baa3e2f3e","observation_id":"a5fdffa2-0e6c-4b55-be1e-d01eca5edba0","resolution":{"observed_at":"2026-07-08T02:34:27.668385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03645","last_updated":"2024-10-04T17:51:33Z","snapshot_observed_at":"2026-07-06T19:27:52.298292Z","submitted_at":"2024-10-04T17:51:33Z","title":"GenSim2: Scaling Robot Data Generation with Multi-modal and Reasoning LLMs","version":1},"cited_work":{"arxiv_id":"2410.03645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03645","snapshot_observed_at":"2026-07-03T11:58:05.915157Z","title":"Gensim2: Scaling robot data generation with multi-modal and reasoning llms.arXiv preprint arXiv:2410.03645","venue":null,"work_id":"68d8b754-1f66-4e21-a31b-65d770c4960d","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2410.03645","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:91891f94f866323573a22878e6be7393aa0537154beafb0184de50d553b98cae","observation_id":"329018f2-72cd-492c-bd47-e69180bbaa95","resolution":{"observed_at":"2026-06-30T18:55:00.196583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.689903Z","title":"Emergence of human to robot transfer in vision-language-action models.arXiv preprint arXiv:2512.22414","venue":null,"work_id":"88fc3778-faad-4626-887f-92a4c4e91800","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:24c9dd162033da018681eacbe23ee688655f02a2b962ed5b71151db3f39ace77","observation_id":"153d1cf6-1429-4da8-96bc-f836a05f04d8","resolution":{"observed_at":"2026-06-30T18:55:00.188954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.661609Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset","venue":null,"work_id":"d800be23-85f3-429c-8138-a6cba83b054b","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:bb694fda8587532fbe6e25beeb1b89e4e8706aa31dd40801edb414edbde5ab6c","observation_id":"18fe7038-584f-4da5-b998-49cb2650963a","resolution":{"observed_at":"2026-07-08T02:34:27.662834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.641566Z","title":"OpenVLA: An open- source vision-language-action model","venue":null,"work_id":"c17a5c9f-5a8d-4ac9-9738-60f8315a744c","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:5a462dab4b86ad0eb2b06f0cb641b711006cca1a303dd4c32618510f50374b6b","observation_id":"43627b06-b2db-4ab3-8ca3-ead90c48b194","resolution":{"observed_at":"2026-07-08T02:34:27.642727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.653963Z","title":"Masquerade: Learn- ing from in-the-wild human videos using data-editing","venue":null,"work_id":"cade2a37-98ca-4123-86ef-7d6acafed125","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:f8f311351a8b468562ccedf1bbc9be1a1706947d7148aefffd344ece4a01807a","observation_id":"65c30495-6782-4bdd-8129-f91b8ab546be","resolution":{"observed_at":"2026-07-08T02:34:27.655220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.650432Z","title":"In the eye of the beholder: Gaze and actions in first person video.IEEE transactions on pattern analysis and machine intelligence, 45(6):6731–6747, 2021","venue":null,"work_id":"9f0c0577-217a-41a7-b806-3e80b970c9a8","year":2021},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:6ad584e2b6a8ce9364389fc9f8abc976329340e8cfbbfb76989b475fbbd5f890","observation_id":"d92a5420-96c3-4473-a06b-3bbdacc18c42","resolution":{"observed_at":"2026-07-08T02:34:27.651685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09227","last_updated":"2024-03-14T09:48:36Z","snapshot_observed_at":"2026-08-06T09:37:53.788323Z","submitted_at":"2024-03-14T09:48:36Z","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","version":1},"cited_work":{"arxiv_id":"2403.09227","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09227","snapshot_observed_at":"2026-07-10T23:17:45.369340Z","title":"BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation","venue":"cs.RO","work_id":"6b62f6a4-fd69-4dd7-b480-b27f0bf09632","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2403.09227","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:b813451dbf2372b7dbb62739a6f7e1555caae48e0a2c9135877b8be9f94ddb06","observation_id":"5f64c9d5-a79b-4fe2-b256-fcf315daf888","resolution":{"observed_at":"2026-06-30T18:55:00.212811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.619041Z","title":"Evaluating real-world robot manipulation policies in simulation","venue":null,"work_id":"e4b2d676-4897-4d66-bd54-c9a9762f4630","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:b2c9f0fcde05613318e8571006ccd786a5e3029f4c0c47961a08de0c5bef0c4a","observation_id":"71edcfae-2d9c-46a5-be2a-735e8fae973f","resolution":{"observed_at":"2026-07-08T02:34:27.620159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.21571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.675799Z","title":"Scalable vision-language-action model pretraining for robotic manipulation with real-life human activity videos","venue":null,"work_id":"c8f06797-dd92-449e-9e82-4a684932eb12","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:c2e712bc033f1ba0935292cb052163eacda7be300d34fc00bb508dee57a4e236","observation_id":"606c1874-ca19-4553-bc0f-a625873fe92c","resolution":{"observed_at":"2026-06-30T18:55:00.218035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.615414Z","title":"HOI4D: A 4d egocentric dataset for category-level human-object interaction","venue":null,"work_id":"5991ee2c-5468-4d0f-a3fa-489783623945","year":2022},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:2af0724c9d892bf46060e432850f6af2e483d0e66452123f64f95d807077c21b","observation_id":"d4411059-2c4c-422e-a189-26b0855789ed","resolution":{"observed_at":"2026-07-08T02:34:27.616732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.645008Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.NIPS, 36:44776–44791, 2023","venue":null,"work_id":"2502f0ff-68de-483b-95ba-2d3027e5f137","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:503e3b959b772f549f29c14d1433a50fca787b5f2710b04a4d2613c35cc4fe78","observation_id":"9f39635a-6bca-46dd-89bf-4475e76d9042","resolution":{"observed_at":"2026-07-08T02:34:27.646214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.643245Z","title":"Taco: Bench- marking generalizable bimanual tool-action-object under- standing","venue":null,"work_id":"04377e62-f9cb-4603-a21b-83e6d534432d","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:edc3d3c42c2fa4d0d653c3971522c35588d3be9199d926149af583fbf76af8c1","observation_id":"6f569bf4-4816-4589-8f13-bf0b7e26407a","resolution":{"observed_at":"2026-07-08T02:34:27.644426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:fbfd456f68dc0ba00117ac09b7f0e74c943c817f2703f7803eb1cfb74642a601","observation_id":"7ab91d45-1471-4c74-b056-ea02fcfc11e3","resolution":{"observed_at":"2026-06-30T18:55:00.210434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.635735Z","title":"VIP: Towards universal visual reward and representation via value-implicit pre-training","venue":null,"work_id":"f34d8ede-ccf7-4cc9-b1f1-ecc2dc305d06","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:4b689a5a61634d52a7f78a24136d4389aae69c08d39c080dad57e224015a0e91","observation_id":"2b81a492-ca1b-4c7d-ae4d-a3ea150ec2fa","resolution":{"observed_at":"2026-07-08T02:34:27.637109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.617026Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks.IEEE Robotics and Automation Letters, 7(3):7327–7334, 2022","venue":null,"work_id":"a4e7ebff-53c4-4c0f-8f83-105cd1675e68","year":2022},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:8cedc3e9e59823d8c198ce91585aae1edfd632ffd0529bd4e45cdf9836ae16f0","observation_id":"8a7e82cc-b8b7-4d15-97e7-03f55b538b76","resolution":{"observed_at":"2026-07-08T02:34:27.618333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.601909Z","title":"Grounding lan- guage with visual affordances over unstructured data","venue":null,"work_id":"da895fed-08ce-4b18-967a-d02a9ba47bd4","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:f5495b919fc7cdf9382b28c40ed6bb683fc2b84a3f33afd8ba6537eccad9e273","observation_id":"fb5629d5-c291-436e-aa8b-2da65eabe43d","resolution":{"observed_at":"2026-07-08T02:34:27.603084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.631974Z","title":"HowTo100M: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"11f6d92a-ac12-43c4-aefd-422ad0294ed1","year":2019},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:56d244f0fa7d0b6151db3cc1cc7eb4b62c14ae460e2bca1ddc587e9caa9f6ad3","observation_id":"15e68163-16c9-4640-bd48-26bee433dff8","resolution":{"observed_at":"2026-07-08T02:34:27.633187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.598486Z","title":"R3M: A univer- sal visual representation for robot manipulation","venue":null,"work_id":"632d7ce8-fb86-4bc5-915e-d1c66572ce6d","year":2022},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:b1e8f28191ee16597eef81437e009181e2b895cc60eca3459527904eff6f3038","observation_id":"efd18abb-8f9c-4d42-addd-9b48a6fb8cf0","resolution":{"observed_at":"2026-07-08T02:34:27.599782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:31200cb59284909c546c8a556447560b7dc6a24f9c4c7915424487a4b518dfd8","observation_id":"bd7696d7-53d8-4403-b85e-56e7a7dda7e5","resolution":{"observed_at":"2026-06-30T18:55:00.234166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.602272Z","title":"Open X- Embodiment: Robotic learning datasets and RT-X models","venue":null,"work_id":"556766d5-e86f-4128-8afc-cbac06866d15","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:0d0a974ac054e3ca32e48c4b7dcd4f2fbed14841fa05e12f17042574a06ba7c6","observation_id":"9cdec0d1-4af6-41f3-a151-b0ad7b47cae4","resolution":{"observed_at":"2026-07-08T02:34:27.603472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":"2512.15692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-07-10T23:07:47.631138Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","venue":"cs.RO","work_id":"cd5b191a-8f67-43d3-8816-0ade1b9a7c29","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:a12251fe3dd70902b3ce043f8115720d749bcfa0bdf4a17c6c8018118515e3c6","observation_id":"5f4d637b-0e20-42ec-8173-c24cfd2c2295","resolution":{"observed_at":"2026-06-30T18:55:00.239698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.630199Z","title":"Dexmv: Imitation learning for dexterous manipulation from human videos","venue":null,"work_id":"a25c7222-24f7-40a2-838d-484601d59875","year":2022},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:e3ef0cb860e9168e072ea5ef3a8d7c65bb563ac76c4e406b3fb66ecc84fcca6c","observation_id":"953c51a5-78dc-40b5-90ac-62856ac1e7e7","resolution":{"observed_at":"2026-07-08T02:34:27.631459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.633800Z","title":"Embodied hands: Modeling and capturing hands and bodies together","venue":null,"work_id":"686651aa-7958-4583-b6e2-cdd3729f025a","year":2017},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:cec9e40f8ce600eacbe6137bfbe4916df3f8cafd4a0016980e8fb9ed3de7dc7a","observation_id":"389845df-7d91-47f9-b581-86ad9aeaaf7b","resolution":{"observed_at":"2026-07-08T02:34:27.635013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07732","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T19:25:32.497295Z","title":"Vipra: Video prediction for robot actions","venue":null,"work_id":"806ae172-9856-4ce3-9c9c-b376df0f0274","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:39b8ccf6528d5aba88eac0d02dc03c9c64fec6206005f9a34334473b559ca49c","observation_id":"576821bc-7506-499f-9199-90fb03a22849","resolution":{"observed_at":"2026-06-30T18:55:00.215340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.637706Z","title":"Assem- bly101: A large-scale multi-view video dataset for under- standing procedural activities","venue":null,"work_id":"5058ca41-525e-4810-a7cf-9f8c4ac98e49","year":2022},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:c325dd061d9f976898e3dc0f556f4ae4ca482ee85c9a6661506480d670c53e77","observation_id":"c399ca70-e946-41b2-9cb4-8b5424075a9d","resolution":{"observed_at":"2026-07-08T02:34:27.638947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.604003Z","title":"Wave humanoid robot","venue":null,"work_id":"09c4f705-6d34-44bb-ad1a-ff923ad4ad4f","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:d6901f6edaa534da88ed58f7aaa483ed610bf2758c3d453ea3e4a3efb4b41aa7","observation_id":"0f68176b-c9b9-4b73-8094-0f2688a036bd","resolution":{"observed_at":"2026-07-08T02:34:27.605085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"cited_work":{"arxiv_id":"2512.03438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.03438","snapshot_observed_at":"2026-07-03T01:37:30.528844Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","venue":"cs.AI","work_id":"bde9d3ec-3c0c-4774-9595-0c4d38ad2730","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2512.03438","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:f6ac47364227eccf4196f27a54733c975f2d868f241cadfeafc9119935957ecc","observation_id":"05dd8d5a-264b-4ebf-a384-e86bce466c59","resolution":{"observed_at":"2026-06-30T18:55:00.226075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:6a6ec53cb9c818b8646560a369d61c17cafdfff0c20f211fba357bf0054404f8","observation_id":"b32ba99c-c08b-4f86-a544-776805df94ba","resolution":{"observed_at":"2026-06-30T18:55:00.223143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.618869Z","title":"Tesla ai day 2022","venue":null,"work_id":"9389b639-015a-497c-981d-54e707ebc753","year":2022},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:4011be60fd6a72c11cc83be76218090b0501a4e1678cafb3c200f0d21eec3462","observation_id":"3046b3f0-d022-4e41-b18a-0d4a94a9b3db","resolution":{"observed_at":"2026-07-08T02:34:27.619919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.639665Z","title":"Neural dis- crete representation learning.NIPS, 30, 2017","venue":null,"work_id":"b37ad7f1-d07a-4625-acae-554161f259b0","year":2017},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:8281f36d4071d194ce21a680a983b3a848cef2cad17f2b7d37d7d4ac98a77388","observation_id":"11f20381-9bfb-4d21-b363-8f8c9d18d0c5","resolution":{"observed_at":"2026-07-08T02:34:27.640829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.712631Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"9e225a90-0e29-4a77-9ba1-bf950857562a","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:aed9992f9e98665c75ff6fa7e054aecb193d460d6671de8e713fc544b2fffc01","observation_id":"fc218ccf-2419-4487-b341-e9f17f755bed","resolution":{"observed_at":"2026-07-08T02:34:27.647937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.652220Z","title":"Holoas- sist: an egocentric human interaction dataset for interac- tive ai assistants in the real world","venue":null,"work_id":"24990818-3ebb-4d67-88d1-2061b208f7b8","year":2023},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:c348774d9ba783c0093d766d0f7418a6dd776a55f28d9fd0aa3ca79958cf25b8","observation_id":"18604bc6-b6c5-45bd-9c41-54b9459c7c76","resolution":{"observed_at":"2026-07-08T02:34:27.653436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.628325Z","title":"Gensim: Generating robotic simulation tasks via large language models, 2024","venue":null,"work_id":"00866b73-3b8a-44d7-9664-cf1bc662e907","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:0d18bb1d1f67ed90909f6a00a5fabdf6f31070bdae33bc23b1ea9d65b08c095f","observation_id":"2857ae1a-cf8c-47b7-a62a-84c5c670841e","resolution":{"observed_at":"2026-07-08T02:34:27.629643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.617274Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":"91ede844-c201-44a9-b7a0-7660c0eac6aa","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:8089d0f9fac6950df9a51be6e52db231ea61733cc6f6afd1be6d9bfd45000bcc","observation_id":"f391e4a6-3a55-476c-a21e-0515ee4d95db","resolution":{"observed_at":"2026-07-08T02:34:27.618477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.624474Z","title":"Unleashing large-scale video generative pre-training for visual robot manipula- tion","venue":null,"work_id":"88c2d2ef-e15b-4cc0-ac88-fd52cab5ebb2","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:0e9e7f6d8e82b4dc7f4e0c91050bf67f1e80b4951285d90db8764f0fdc4b2345","observation_id":"3118baa4-8fbf-4b22-bda3-f1967bc205ca","resolution":{"observed_at":"2026-07-08T02:34:27.625882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":"2203.06173","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-07-08T01:44:26.089441Z","title":"Masked visual pre-training for motor control","venue":"cs.CV","work_id":"87cf1bc9-a17c-4f06-8a24-80a4a1051a0b","year":2022},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:eda8a4fee23533e1e2584f9ab81a1484db932ddbb85cd390b515d109b8f8bc41","observation_id":"27d7170c-9200-4b90-8d4d-b8a25be6e0ae","resolution":{"observed_at":"2026-06-30T18:55:00.220581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.622281Z","title":"A0: An affordance- aware hierarchical model for general robotic manipulation","venue":null,"work_id":"0164b681-4fde-4d9e-8b9e-626f9cab85b8","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:e1962b5de300036768e95f7dbd776d65603d2a4f9ab11e302190cf2d35aaf4dc","observation_id":"269bca05-ac26-4422-9c6b-98dbf958e131","resolution":{"observed_at":"2026-07-08T02:34:27.623556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.626587Z","title":"Magma: A foundation model for multimodal AI agents","venue":null,"work_id":"13605857-ee37-4e9d-bf66-e998296acdbf","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:0342f233bf2b420405f0fc7f58540ff13148c9684df2b4324258473daf77922d","observation_id":"1a707b6e-a375-4e66-b430-47f35023bdd6","resolution":{"observed_at":"2026-07-08T02:34:27.627765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:73f74a0b6dc0db66c0ebf124c3736c25f421a9402bf59b7af1e1452e28b4b82c","observation_id":"b95a5978-599b-4eb8-a88c-ceba7b7e504b","resolution":{"observed_at":"2026-06-30T18:55:00.228649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.628725Z","title":"Latent action pretrain- ing from videos","venue":null,"work_id":"b701da44-cc7c-4b7c-895e-755b4532979d","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:a274e43b6e06183984f9921238017e32c16903b17137459b271c3e32c6593a36","observation_id":"db5b6368-63f2-49b6-b3d7-e41a8df41f3f","resolution":{"observed_at":"2026-07-08T02:34:27.629913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21986","doi":"10.48550/arxiv.2509.21986","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yoshida, S","venue":"arXiv (Cornell University)","work_id":"4e7e220e-073b-4c30-ba17-8afe93a482d3","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:edbc10093c9d67b121dddaa0833f2edcd643a2841aef82d94daac2885689e8ef","observation_id":"9562be4b-65d1-4414-9562-a570989a887e","resolution":{"observed_at":"2026-06-30T18:55:00.237030Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:0ad35dfed44cc0895535a1e6c196d94ba82f51ddffa5793d132f5b83cbbf31fd","observation_id":"bfa07efb-88b5-44d9-8e6d-e3e2f65905a8","resolution":{"observed_at":"2026-06-30T18:55:00.231722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.613628Z","title":"Motiontrans: Human vr data enable motion-level learning for robotic manipulation policies","venue":null,"work_id":"3a2c657a-4b83-44aa-94d0-e29325835041","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:d4b169bb00b60902ccd2ab8263dcdbf1f73dd993b465d26b609c59b70966ff56","observation_id":"6fdb062d-9680-4156-89ef-993a3362db72","resolution":{"observed_at":"2026-07-08T02:34:27.614821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.648489Z","title":"Hermes: Human- to-robot embodied learning from multi-source motion data for mobile dexterous manipulation","venue":null,"work_id":"c5c24a6d-2f6a-426a-b52b-f45e1bfe4c1a","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:159b7a35af01488756cfcec7622e9ba1913860d582f349be27ad66b2b276a40f","observation_id":"fbcd2d81-cb21-4130-8d32-5b86d58cd5c9","resolution":{"observed_at":"2026-07-08T02:34:27.649852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.611852Z","title":"Oakink2: A dataset of bimanual hands-object manipulation in complex task com- pletion","venue":null,"work_id":"2c0f8681-2d20-4237-ae45-cc9da823ec0e","year":2024},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:efb4a0c6417cd19d251a7a4add07aed708d58d82f40d41fc833dde1d5ccc2c1e","observation_id":"6caa56c7-1f6d-4819-999b-0ee45f8db512","resolution":{"observed_at":"2026-07-08T02:34:27.613032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.620709Z","title":"Clap: Contrastive la- tent action pretraining for learning vision-language-action models from human videos, 2026","venue":null,"work_id":"0f882c4c-f2d3-4cab-86e7-0c3f29640d9a","year":2026},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:477d9fde34d6bf2e025d75ad2f52f5249c5f899580afe0ca27d2ae69901ad5a3","observation_id":"08e0b236-24c0-4550-9dbd-52fbc22692dd","resolution":{"observed_at":"2026-07-08T02:34:27.621908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.622408Z","title":"FLARE: Robot learning with implicit world modeling","venue":null,"work_id":"b81fc1c4-b7af-4b6e-8865-bb2bbc056f48","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:a87770d17785bed1c3a9898aecc0d936d38cdae21ca35afa3f12cd6acfaa1939","observation_id":"82709cb9-2929-4f90-9aa9-52c33c84bc01","resolution":{"observed_at":"2026-07-08T02:34:27.623717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.630493Z","title":"Zhu, Pranav Kuppili, et al","venue":null,"work_id":"1ae0efe5-3c33-422d-b568-968c3431ebc6","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:459c96d934acc6125df032f4da0863c852e141ec7357d5f2f9747625c8b512cf","observation_id":"4cfc41cf-317e-435f-996b-5b2f28bcbf23","resolution":{"observed_at":"2026-07-08T02:34:27.631645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":54},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 1 inbound Pith citation observation for arXiv:2606.00054."}