{"as_of":"2026-08-14T14:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1cfcec8c18c96612dc1d04d3f7a20a65bf24b812af1967f9e5eed48a77fcd2b","coverage":[{"denominator":161,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:33:46.663820Z","state":"measured"},{"denominator":163,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":163,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":63,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:10:14.892153Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T04:16:48.668605Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T18:50:16.766190Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09671","last_updated":"2025-09-11T17:59:07Z","snapshot_observed_at":"2026-08-13T16:55:02.694181Z","submitted_at":"2025-09-11T17:59:07Z","title":"Dexplore: Scalable Neural Control for Dexterous Manipulation from Reference-Scoped Exploration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:50:16.766190Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2509.09671"},"observation_digest":"sha256:984c304c4c3f536f519a68dadae65d77906adb1330d2fb12ae2bd109c7da2b10","observation_id":"8b59d164-430f-4446-9e55-2a5eac4ef086","resolution":{"observed_at":"2026-08-04T18:50:16.766190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T07:00:46.531852Z","title":"Being-h0: Vision-language-action pretraining from large- scale human videos.arXiv preprint arXiv:2507.15597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-13T13:13:01.528752Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.531852Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:475f71ac01fedc8b00c43ddc27e1f1ff75aed10ecec1fc48216a45238aa1aa0b","observation_id":"8ea14750-e58d-4048-b56d-b8b74d8d3eb6","resolution":{"observed_at":"2026-08-04T07:00:46.531852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2511.18127","last_updated":"2026-05-15T06:06:57Z","snapshot_observed_at":"2026-08-12T00:34:54.573058Z","submitted_at":"2025-11-22T17:22:24Z","title":"SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T17:53:19.002603Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2511.18127"},"observation_digest":"sha256:e821637fcbc9cfea3863bafda4e6909e8ee20a02a5bdb3796f1c8bd6560ab1e2","observation_id":"a8f85282-66ee-412a-84da-64e4d1894b45","resolution":{"observed_at":"2026-05-21T17:54:18.265883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-03T19:11:42.870351Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01715","last_updated":"2026-07-01T14:29:04Z","snapshot_observed_at":"2026-08-11T01:23:42.659830Z","submitted_at":"2025-12-01T14:21:15Z","title":"Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:42.870351Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2512.01715"},"observation_digest":"sha256:ca81173be76fe6847ba321699c03187052b8c83096d369a1fafc76bd04ad0520","observation_id":"228ccdd7-920f-40ef-bcab-b572bd8fc53a","resolution":{"observed_at":"2026-08-03T19:11:42.870351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-03T04:18:55.692685Z","title":"Being-H0: Vision- Language-Action Pretraining from Large-Scale Human Videos.Preprint at arXiv:2507.15597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05513","last_updated":"2026-07-14T09:20:36Z","snapshot_observed_at":"2026-08-09T06:59:08.037845Z","submitted_at":"2026-02-05T10:13:34Z","title":"DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:18:55.692685Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2602.05513"},"observation_digest":"sha256:6e4488ec4705d5c537a30737668a37febd0b75372bc8dbd7ea6639b8f64275c3","observation_id":"14292983-4c79-4716-84d6-caa3591e71cf","resolution":{"observed_at":"2026-08-03T04:18:55.692685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T17:02:33.997887Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2602.06949"},"observation_digest":"sha256:4561c6949bd1cba25ea02fdfd9b3c5db754cceed3a30f52cca032cb630026a39","observation_id":"ce3dc394-c737-4508-8cc6-ddc2e5d46e0c","resolution":{"observed_at":"2026-05-16T17:02:34.356382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2602.10698","last_updated":"2026-02-11T09:57:32Z","snapshot_observed_at":"2026-08-11T15:16:51.530916Z","submitted_at":"2026-02-11T09:57:32Z","title":"AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T06:01:30.803128Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2602.10698"},"observation_digest":"sha256:cb4186a4dd5c94973d5e90da056b088d4a49728bb7323f8c6973a8948028e045","observation_id":"df45d407-7e35-4e6c-ae92-b93786349036","resolution":{"observed_at":"2026-05-16T06:02:24.979717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T23:57:44.645995Z","title":"Being-h0: vision-language-action pre- training from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12215","last_updated":"2026-06-03T04:04:20Z","snapshot_observed_at":"2026-08-02T23:57:43.860710Z","submitted_at":"2026-02-12T17:53:51Z","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T23:57:44.645995Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2602.12215"},"observation_digest":"sha256:87bcff4f1b34673216264a1c8d1c8989f39172fdbdd002b178f8239743a99bc5","observation_id":"4bb248b3-fd46-4cde-a901-5771d349e93c","resolution":{"observed_at":"2026-08-02T23:57:44.645995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2603.00110","last_updated":"2026-04-23T12:54:44Z","snapshot_observed_at":"2026-08-10T22:29:48.430468Z","submitted_at":"2026-02-18T14:58:18Z","title":"Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T21:22:41.935691Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2603.00110"},"observation_digest":"sha256:a289ab8d181a70a9a4859c1fd1c492cbeff0c3048c0d0c83517c3365898d8431","observation_id":"66e903d4-96b3-4591-9df8-7feafe535f33","resolution":{"observed_at":"2026-05-15T21:30:20.893877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-13T21:11:31.022938Z","title":"Being-h0: Vision-language-action pre- training from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.20850","last_updated":"2026-06-08T23:42:26Z","snapshot_observed_at":"2026-08-13T18:23:25.253281Z","submitted_at":"2026-03-21T15:12:57Z","title":"Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T21:11:31.022938Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2603.20850"},"observation_digest":"sha256:f51136d23a45c41a245ec9cf837da7f511d5667c75c82c19444a24d3f5559565","observation_id":"995409de-51e6-4c60-8313-a0d448e7afc8","resolution":{"observed_at":"2026-07-13T21:11:31.022938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-08-10T10:03:25.795206Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T17:07:41.489995Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:3d2b4bc04956c47f32c77fc8392bb352cf6f95d585316ba3d9f1726320251837","observation_id":"3f1506ab-6795-42ac-a247-a675d0621889","resolution":{"observed_at":"2026-05-11T07:35:57.002389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-13T08:25:22.011013Z","title":"Being-h0: Vision-language-action pre- training from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-08-10T10:03:25.795206Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T08:25:22.011013Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:fe9d9e30becee9565b33b7e3b71ee6e981e055ed158665ffbb9ce151496399da","observation_id":"0d1f7b55-f0f4-4ffb-a777-628617c0a3dd","resolution":{"observed_at":"2026-07-13T08:25:22.011013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.10677","last_updated":"2026-04-12T15:02:34Z","snapshot_observed_at":"2026-08-14T02:40:45.565046Z","submitted_at":"2026-04-12T15:02:34Z","title":"LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:36:23.197843Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.10677"},"observation_digest":"sha256:8ea8694a70bf034e09880dd501351e960083011f8f5d38befe49ba66a5402c12","observation_id":"792b1e76-3bab-4a37-bf0e-e6655d513d82","resolution":{"observed_at":"2026-05-11T10:11:03.890345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.13645","last_updated":"2026-04-15T09:14:43Z","snapshot_observed_at":"2026-08-11T02:17:27.544985Z","submitted_at":"2026-04-15T09:14:43Z","title":"A Mechanistic Analysis of Sim-and-Real Co-Training in Generative Robot Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T12:29:38.306670Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.13645"},"observation_digest":"sha256:0823422f69a0dbd9370095bddde479139f6c63ccb713a0f9d992617ad777b512","observation_id":"64153462-9782-4f60-8a31-79fdad4c8103","resolution":{"observed_at":"2026-05-10T12:30:22.689485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.18000","last_updated":"2026-04-20T09:25:30Z","snapshot_observed_at":"2026-08-03T00:50:48.601549Z","submitted_at":"2026-04-20T09:25:30Z","title":"Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T04:27:18.284698Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.18000"},"observation_digest":"sha256:b6f00db4f25712f6796b087c46d806777f8d1b31b02e267febd5bf5fb668590e","observation_id":"2a2c6c44-858e-4db3-8980-fbea3cac73d0","resolution":{"observed_at":"2026-05-11T11:56:29.409174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.23570","last_updated":"2026-04-26T07:21:15Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T07:21:15Z","title":"EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T06:19:34.743194Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.23570"},"observation_digest":"sha256:af633ff40742cef462a89f05a30dc8f3f408b004f86c98ea3eb62c8f17bcc4ff","observation_id":"fdef3828-756b-4c33-8992-1d37bb0ebb4b","resolution":{"observed_at":"2026-05-11T21:16:11.740209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T02:51:27.662262Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:529650889bd765dcdbc8c92b6d80c48f1007a46961a5d8bcb0afb6265e7ecfcb","observation_id":"8fceb112-ea8a-4399-9ffb-052c51f8bd42","resolution":{"observed_at":"2026-05-11T22:26:11.725302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T11:16:58.104663Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:018114045ec3577aef866a8065f51668141bfa7cb6bac92a4e39a3f9f8d9d139","observation_id":"17e17457-c4f2-43ba-8fd9-251ff72234fa","resolution":{"observed_at":"2026-05-22T11:21:29.156747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T20:48:01.461993Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.00078"},"observation_digest":"sha256:dd491cdae1372434338c694206437e52d31a04a64fe9b45399c703a03ea9d36f","observation_id":"ced91d16-378a-404b-8909-be2b52314578","resolution":{"observed_at":"2026-05-11T14:56:08.488051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.00080","last_updated":"2026-04-30T14:35:31Z","snapshot_observed_at":"2026-08-04T20:02:32.182599Z","submitted_at":"2026-04-30T14:35:31Z","title":"World Model for Robot Learning: A Comprehensive Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T20:38:12.709629Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.00080"},"observation_digest":"sha256:92b2db80b3e1a8011b027f2b0344e3bc971d53c629e6b20f2be9765e2b21f217","observation_id":"13379a2f-4b85-4ade-9d08-19553221a7e8","resolution":{"observed_at":"2026-05-11T15:11:04.931247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.06747","last_updated":"2026-05-07T15:21:58Z","snapshot_observed_at":"2026-08-09T19:59:54.117138Z","submitted_at":"2026-05-07T15:21:58Z","title":"HumanNet: Scaling Human-centric Video Learning to One Million Hours","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T00:51:08.414394Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.06747"},"observation_digest":"sha256:df35884aa670768f4bcd77fd2e4cad809c6a97be3ac22da78b27d1cb03aee517","observation_id":"fe5defcd-459a-4c6d-9907-f07a38569958","resolution":{"observed_at":"2026-05-11T05:10:54.148923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":203,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:31d109c27043fe003772534de5bad8bd763a298b66bad0b304792ccc4fc00097","observation_id":"a47c22ac-14c5-4628-abbb-cb6baa225d67","resolution":{"observed_at":"2026-05-13T05:07:17.846258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.13925","last_updated":"2026-05-13T15:23:17Z","snapshot_observed_at":"2026-08-11T06:10:13.835449Z","submitted_at":"2026-05-13T15:23:17Z","title":"Towards Robotic Dexterous Hand Intelligence: A Survey","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-05-15T05:44:23.945064Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.13925"},"observation_digest":"sha256:210d8674af34b3ab26745bd0a04afc0dddc1911051b8109903cd8ad2e53462a8","observation_id":"f15d5d9b-626c-4120-bb49-7f6ebdfa7de5","resolution":{"observed_at":"2026-05-15T05:45:06.046963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.15157","last_updated":"2026-05-20T14:31:09Z","snapshot_observed_at":"2026-08-14T14:28:53.120868Z","submitted_at":"2026-05-14T17:51:40Z","title":"Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T03:09:26.858170Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.15157"},"observation_digest":"sha256:0539237c2ac4212888d8ad1600f0320db6db3076ca4a8e481c4fd18b0d7342bf","observation_id":"e6258c08-aa48-4067-98fd-59a673b365a8","resolution":{"observed_at":"2026-05-15T03:09:42.122084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.15157","last_updated":"2026-05-20T14:31:09Z","snapshot_observed_at":"2026-08-14T14:28:53.120868Z","submitted_at":"2026-05-14T17:51:40Z","title":"Hand-in-the-Loop: Improving VLA Policies for Dexterous Manipulation via Seamless Hand-Arm Intervention","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T08:31:57.077346Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.15157"},"observation_digest":"sha256:50b4af7af0a017a6aefb2673104845b66307d67cae08340c2c1edc86ff50ccc9","observation_id":"51ee9ed2-a371-49ed-b5cc-a6fd44d4c33b","resolution":{"observed_at":"2026-05-21T08:34:05.565221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.18722","last_updated":"2026-05-18T17:50:32Z","snapshot_observed_at":"2026-08-14T06:49:46.924911Z","submitted_at":"2026-05-18T17:50:32Z","title":"Dexora: Open-source VLA for High-DoF Bimanual Dexterity","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T09:43:53.032153Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.18722"},"observation_digest":"sha256:eaecd902d69c5b0d807f3fe5cbd601a10e3fe2bf82a918ae11f9310cde34bef0","observation_id":"7b6ac8ad-7cde-43e6-9872-23eaf06c23d0","resolution":{"observed_at":"2026-05-20T09:48:11.778910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.25044","last_updated":"2026-05-24T12:41:34Z","snapshot_observed_at":"2026-08-03T04:47:12.844303Z","submitted_at":"2026-05-24T12:41:34Z","title":"X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T00:18:33.150920Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.25044"},"observation_digest":"sha256:3641f8755b1295036da9478cd91206f8bb7cec41b023937ecd7151a4b921a21e","observation_id":"b88443ab-14a4-4068-9482-5c141b4c9267","resolution":{"observed_at":"2026-06-30T00:24:04.188694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2605.30226","last_updated":"2026-06-06T09:12:27Z","snapshot_observed_at":"2026-08-01T05:57:18.931232Z","submitted_at":"2026-05-28T16:57:47Z","title":"BORA: Bridging Offline Reinforcement Learning and Online Residual Adaptation for Real-World Dexterous VLA Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T07:18:59.266263Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2605.30226"},"observation_digest":"sha256:6682ad7bbfa6a254f664301aa6cf3228a5edd9c48d784db6c3db0efa233a89f7","observation_id":"3b4d04cf-4c1d-4503-9490-b72a87ba08e3","resolution":{"observed_at":"2026-06-29T07:23:12.768238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:5efd2bd422b625a7d538cd0fbf5b53972cf80f1fe78684976dc573162dc0b5db","observation_id":"7ab91d45-1471-4c74-b056-ea02fcfc11e3","resolution":{"observed_at":"2026-06-30T18:55:00.210434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.00110","last_updated":"2026-05-27T03:38:15Z","snapshot_observed_at":"2026-08-06T22:19:24.528783Z","submitted_at":"2026-05-27T03:38:15Z","title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","version":1},"reference_index":220,"source":"arxiv_source","source_observed_at":"2026-06-29T13:33:03.368006Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.00110"},"observation_digest":"sha256:677008cc742885f8404023fea4b1461930c4302b3ff14ea9da28db87fe0ea31a","observation_id":"fd4dd992-0dc2-4880-be98-213785842ab2","resolution":{"observed_at":"2026-06-29T13:33:27.773712Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.03868","last_updated":"2026-06-02T16:39:23Z","snapshot_observed_at":"2026-07-06T23:44:05.167767Z","submitted_at":"2026-06-02T16:39:23Z","title":"Unified Video-Action Joint Denoising for Dexterous Action and Data Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T10:28:22.430294Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.03868"},"observation_digest":"sha256:5068d86a7df0c8b6d08b11b66d7c5293a23a479dd73589cc8468637659cf1a20","observation_id":"e1fb98e0-3d75-4e42-bbdf-70f7cd08c5c7","resolution":{"observed_at":"2026-07-02T02:56:29.363432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.05979","last_updated":"2026-06-04T10:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T10:23:01Z","title":"World-Language-Action Model for Unified World Modeling, Language Reasoning, and Action Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T01:05:26.382826Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.05979"},"observation_digest":"sha256:693d21ec357d9250775415ebfa866beeeda4cba19f4f75dbb33584308bbc3905","observation_id":"9bb1aec4-8dd7-4f1e-8274-da739a390b14","resolution":{"observed_at":"2026-07-02T13:46:58.909752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.06033","last_updated":"2026-06-06T19:36:14Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T11:28:23Z","title":"RealDexUMI: A Wearable Universal Manipulation Interface for Dexterous Robot Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T01:44:32.716179Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.06033"},"observation_digest":"sha256:087cdc7eeacca412d650b68862d53b5efb7c8329ba1128d6ccc320f2af742e33","observation_id":"389ecd41-aead-427a-bbcc-05e33a2970c7","resolution":{"observed_at":"2026-07-02T12:56:57.100854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T22:25:17.522240Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:4d6d841de5e35583f4f7601dc836a355c55bd64cdcb85e5455eca8b9b831da21","observation_id":"79d0f620-2bb8-42da-992b-afc11cad27bc","resolution":{"observed_at":"2026-07-02T16:47:09.505386Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-01T07:17:42.045939Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:e6ea1f45ed141ac160132c96451b84a2a18e4a7a72899748a99fd39e32a589ac","observation_id":"ca0da9aa-21c0-490f-bec8-32def5ec9703","resolution":{"observed_at":"2026-07-01T08:35:34.493805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.09457","last_updated":"2026-06-24T12:51:19Z","snapshot_observed_at":"2026-08-02T02:13:19.124258Z","submitted_at":"2026-06-08T13:12:56Z","title":"$\\omega$-EVA: Envision, Verify, and Act with Latent Interactive World Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T16:10:02.176202Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.09457"},"observation_digest":"sha256:ca390a6001604099010ebd532287ddb66224c49920ddde4445442943d6713cb1","observation_id":"462e6594-bd69-49ee-bb7c-2f578b6c608b","resolution":{"observed_at":"2026-07-03T02:07:33.742396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.11187","last_updated":"2026-06-09T17:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-09T17:59:22Z","title":"Next Forcing: Causal World Modeling with Multi-Chunk Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:53.905704Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.11187"},"observation_digest":"sha256:343863a32157a00f8fdb23db9ff66d50329a3c5fca6e048c3d01ffc0caded078","observation_id":"18ae0df7-1766-4f47-9266-4fe04473699e","resolution":{"observed_at":"2026-07-03T04:57:38.513373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.11628","last_updated":"2026-06-10T03:49:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T03:49:01Z","title":"LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T10:02:54.183839Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.11628"},"observation_digest":"sha256:a5bb5f5f858279e4f3b02432471308082313df588aa4c8127015de012bee85a1","observation_id":"bfee454c-5b31-4cba-9671-a3779d34a43c","resolution":{"observed_at":"2026-07-03T10:27:56.220598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.17846","last_updated":"2026-06-17T17:06:39Z","snapshot_observed_at":"2026-08-01T08:00:11.218777Z","submitted_at":"2026-06-16T12:14:39Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:59.969040Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.17846"},"observation_digest":"sha256:2c7bd05c4ed769e52b29d5fdcfe89def8ad79f3d4c4bf45b448b21db38b12373","observation_id":"67082a9d-78e1-4134-b360-31a571b052fa","resolution":{"observed_at":"2026-07-03T20:48:55.855989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.19333","last_updated":"2026-06-17T17:57:34Z","snapshot_observed_at":"2026-08-12T21:11:47.095223Z","submitted_at":"2026-06-17T17:57:34Z","title":"Do as I Do: Dexterous Manipulation Data from Everyday Human Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T20:51:21.209882Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.19333"},"observation_digest":"sha256:0aa3f95702ffdcf79ea48c98f7b10ed37b354a39d05a42e1d8782651b0118a6b","observation_id":"b1983b03-9216-4236-8dcf-73e1abbe4232","resolution":{"observed_at":"2026-07-04T00:59:19.497076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.19340","last_updated":"2026-06-19T13:42:23Z","snapshot_observed_at":"2026-08-02T05:06:10.398443Z","submitted_at":"2026-06-17T17:59:56Z","title":"ZeroDex: Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T20:49:01.269513Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.19340"},"observation_digest":"sha256:e28f81b3baf8d57eb55e9b693bf53591fda7dfb45e45b5eb4a2244207ba56e95","observation_id":"25489053-9cea-4a60-8674-87b32178ba29","resolution":{"observed_at":"2026-07-04T00:59:20.363664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.20521","last_updated":"2026-06-18T17:37:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-18T17:37:34Z","title":"HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T17:53:24.431287Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.20521"},"observation_digest":"sha256:ed1aef83e31c7d8fa5e548af1b9ccd319cd8eb6ebbdea545151a35eba7b6547e","observation_id":"6ed30d62-4531-400c-b6a4-28aeb16a039e","resolution":{"observed_at":"2026-07-04T03:39:29.683310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.22136","last_updated":"2026-06-23T09:28:18Z","snapshot_observed_at":"2026-08-06T21:01:23.847051Z","submitted_at":"2026-06-20T16:31:40Z","title":"Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T11:47:54.951618Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.22136"},"observation_digest":"sha256:6758eb8a5f69b5249a00c53b9e7f3e5c1733b61dbc5e8a44d2e108e1a58009ce","observation_id":"73810ba6-6a3f-488b-922b-b89b9011c5fd","resolution":{"observed_at":"2026-07-04T08:19:44.736280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.24448","last_updated":"2026-06-23T11:35:13Z","snapshot_observed_at":"2026-08-03T06:59:21.107836Z","submitted_at":"2026-06-23T11:35:13Z","title":"Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-25T23:57:48.395172Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.24448"},"observation_digest":"sha256:1693c4daa839e0c7f10b9de9ce202aea3a5a62d88728fa02164a50276c6ab7e5","observation_id":"8e24bd8d-ec6c-4acb-8ff3-dd8b1f91a3b6","resolution":{"observed_at":"2026-07-04T17:09:58.480120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.28133","last_updated":"2026-06-26T14:34:04Z","snapshot_observed_at":"2026-08-05T12:02:21.397136Z","submitted_at":"2026-06-26T14:34:04Z","title":"Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T04:23:04.622902Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.28133"},"observation_digest":"sha256:959a5c467b4353d34f310b0e1898c2df723a013a1456d27b0f7cdb84495e8e79","observation_id":"d836be21-89c4-4eb5-b6bd-f59877630a17","resolution":{"observed_at":"2026-07-01T16:55:51.368357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2606.32009","last_updated":"2026-06-30T17:44:16Z","snapshot_observed_at":"2026-08-13T03:04:26.117288Z","submitted_at":"2026-06-30T17:44:16Z","title":"Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T05:02:17.092213Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2606.32009"},"observation_digest":"sha256:ab0b9f5f7fab70a3305340a614c8d453bedff809ae2871ba39b2c2453839c77e","observation_id":"a6366124-29b5-4006-a58d-fff533a68f5b","resolution":{"observed_at":"2026-07-01T10:55:41.344117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2607.01067","last_updated":"2026-07-01T15:26:26Z","snapshot_observed_at":"2026-08-12T12:11:04.612463Z","submitted_at":"2026-07-01T15:26:26Z","title":"Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-02T11:18:32.259684Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.01067"},"observation_digest":"sha256:82f8717aaf2e59eb99a1ab1acef8b68b9e05b87b4306b629feb17112b60e7392","observation_id":"f5181d8a-4432-4e9d-b577-41cd6ea9a2ff","resolution":{"observed_at":"2026-07-02T11:26:54.003775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2607.06403","last_updated":"2026-07-07T15:33:12Z","snapshot_observed_at":"2026-08-06T21:08:13.002956Z","submitted_at":"2026-07-07T15:33:12Z","title":"From Foundation to Application: Improving VLA Models in Practice","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T07:06:13.473493Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.06403"},"observation_digest":"sha256:2cdfce18c6e45396a3ec14ac73b09e194fa1db2a81819d586adcd2d2c0e1e948","observation_id":"c898bc55-29e6-4ff2-b04c-63542be34257","resolution":{"observed_at":"2026-07-08T07:14:45.445289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2507.15597","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-10T04:16:48.668605Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos","venue":"cs.CV","work_id":"5aebd66f-99a4-4264-a778-dd17abb8d446","year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-10T04:12:29.153764Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:b817f769bd35aadfd511f067aed34d265cdb0a0011b5a87686451db0baab8980","observation_id":"caedafdc-980f-48df-93e8-8e0073c6f14a","resolution":{"observed_at":"2026-07-10T04:16:48.670270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T07:53:38.754872Z","title":"Being-h0: Vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:38.754872Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:1d385370116c23c4e5d2bc6f0bce34946196adb70ea68120930f0cec33172b60","observation_id":"f742ffaf-db65-4417-84e8-dc83c1b193ce","resolution":{"observed_at":"2026-08-02T07:53:38.754872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-14T17:30:54.988498Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09701","last_updated":"2026-06-21T16:16:02Z","snapshot_observed_at":"2026-08-01T23:36:03.315592Z","submitted_at":"2026-06-21T16:16:02Z","title":"EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T17:30:54.988498Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.09701"},"observation_digest":"sha256:518c13e7f0654b7d17ae17c5d4b24d6d5d29baac8248ae7e02e62524ba15c8f3","observation_id":"2766f5a6-6e0c-4c25-8cc5-2eea594df53e","resolution":{"observed_at":"2026-07-14T17:30:54.988498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T03:25:28.115858Z","title":"Being-H0: Vision-language-action pretraining from large-scale human videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14183","last_updated":"2026-07-18T10:02:02Z","snapshot_observed_at":"2026-08-14T11:23:58.254955Z","submitted_at":"2026-07-15T14:49:49Z","title":"Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:25:28.115858Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.14183"},"observation_digest":"sha256:52ed540a688cb486f84f94e54c4522deb6b527a3d6cc83e0fcfbc7a9bb330445","observation_id":"2138be29-39f8-4103-9629-8bd6580c280d","resolution":{"observed_at":"2026-08-02T03:25:28.115858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T00:04:05.119524Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-13T19:37:32.467999Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.119524Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ec8967f96e7a98a8b240bda7f505be4f46b374f85a6dcc60bcd8b73d3419882c","observation_id":"5efc2714-0f33-4327-81ef-d8033792d4ec","resolution":{"observed_at":"2026-08-02T00:04:05.119524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-01T19:06:43.487945Z","title":"arXiv preprint arXiv:2507.15597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17097","last_updated":"2026-07-19T06:41:53Z","snapshot_observed_at":"2026-08-12T22:35:45.043698Z","submitted_at":"2026-07-19T06:41:53Z","title":"HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-08-01T19:06:43.487945Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.17097"},"observation_digest":"sha256:591d6a219cb8f9de538ab56567f1806b509b6f93bdeab39e500bb3b9cf22ad57","observation_id":"58695d96-07e2-4795-85c2-02cc499f5d1d","resolution":{"observed_at":"2026-08-01T19:06:43.487945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-31T23:29:10.712814Z","title":"arXiv preprint arXiv:2507.15597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-13T05:20:17.507917Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:10.712814Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:70b0b37f65a5be6f4d904275cbbaece0c27ecbffc4535ab41e5da53f7da03dfa","observation_id":"baf6ea43-c392-463e-9ea5-59d2c684839b","resolution":{"observed_at":"2026-07-31T23:29:10.712814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-31T06:18:55.854691Z","title":"Being-h0: Vision-language-action pretraining from large-scale human videos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-08-08T15:15:40Z","snapshot_observed_at":"2026-08-13T23:17:19.547551Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation: A Survey","version":1},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.854691Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:c78677f6e5bc4265b1c5e877af3ec0825d3ee7624175db1c584c2bc8f0e2d10a","observation_id":"fcd9e4a2-c9cb-44ad-a3cb-036e28beb184","resolution":{"observed_at":"2026-07-31T06:18:55.854691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-07-31T08:51:29.293605Z","title":"Being-h0: vision- language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T23:11:29.841318Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":1},"reference_index":227,"source":"pdf_text","source_observed_at":"2026-07-31T08:51:29.293605Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:311266fc38e2791ba00ee16c9f7330a1b9670b58a90f54851ac27ec3cd73781e","observation_id":"012798cc-eb2f-46ec-a04b-3a3a4f9b30b8","resolution":{"observed_at":"2026-07-31T08:51:29.293605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T01:23:10.898271Z","title":"Being-h0: vision- language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T23:11:29.841318Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":208,"source":"pdf_text","source_observed_at":"2026-08-04T01:23:10.898271Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:47bb00ffb17dba662c884b69893de38eda291d7d38bea5ab0398107dcbdd2b98","observation_id":"719960a9-0211-4c33-8590-b2815129ed21","resolution":{"observed_at":"2026-08-04T01:23:10.898271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T18:35:26.658756Z","title":"arXiv preprint arXiv:2507.15597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01905","last_updated":"2026-08-06T13:24:49Z","snapshot_observed_at":"2026-08-14T00:44:43.534745Z","submitted_at":"2026-08-03T08:39:31Z","title":"PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T18:35:26.658756Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.01905"},"observation_digest":"sha256:f5c04e99cfde208d869549aff70e12e3a7c6942909241ff4fe64111eb72b0a99","observation_id":"e0a809f7-8b0d-4924-99dd-b9e9b18e3015","resolution":{"observed_at":"2026-08-04T18:35:26.658756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-07T04:10:14.892153Z","title":"arXiv preprint arXiv:2507.15597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01905","last_updated":"2026-08-06T13:24:49Z","snapshot_observed_at":"2026-08-14T00:44:43.534745Z","submitted_at":"2026-08-03T08:39:31Z","title":"PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:10:14.892153Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.01905"},"observation_digest":"sha256:35cee42df307271b6aa522131b20eacfdebfafacf9d31c5c8a7cf9fabebd9b21","observation_id":"6434a5c5-d393-40ae-b61a-1c6cd850d6d0","resolution":{"observed_at":"2026-08-07T04:10:14.892153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-04T04:25:52.097084Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02580","last_updated":"2026-08-03T17:52:26Z","snapshot_observed_at":"2026-08-13T16:18:28.887984Z","submitted_at":"2026-08-03T17:52:26Z","title":"Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T04:25:52.097084Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.02580"},"observation_digest":"sha256:f550195ed2dc718a64896876bd23a0a42ccdb131cc29e3b1c67422825ad56849","observation_id":"67c89dc8-ab09-47eb-9697-ebc544dd42f5","resolution":{"observed_at":"2026-08-04T04:25:52.097084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-05T00:58:35.689675Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03127","last_updated":"2026-08-04T04:55:47Z","snapshot_observed_at":"2026-08-09T05:19:16.888543Z","submitted_at":"2026-08-04T04:55:47Z","title":"DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T00:58:35.689675Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.03127"},"observation_digest":"sha256:0f7db8377719ffa67cee6c3797f96127267dbf6db63e6e0b2856cac2871f4931","observation_id":"db8ecbb9-fb0a-4255-93ec-bd6f50059c1b","resolution":{"observed_at":"2026-08-05T00:58:35.689675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-07T04:08:32.515534Z","title":"Being-h0: Vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06374","last_updated":"2026-08-06T17:59:20Z","snapshot_observed_at":"2026-08-13T07:40:46.791650Z","submitted_at":"2026-08-06T17:59:20Z","title":"DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:32.515534Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2608.06374"},"observation_digest":"sha256:f3343eb1a360fc1cfbe5520c3ec4eafede0edef66418c1e50847ec0f930c4110","observation_id":"36d4981d-d08b-4f6a-85bd-92b8aed13ce4","resolution":{"observed_at":"2026-08-07T04:08:32.515534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15597/citation-record","integrity":"/paper/2507.15597/integrity","json":"/paper/2507.15597/citation-record.json","paper":"/paper/2507.15597"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:38.030744Z","title":"Review on human-like robot manipula- tion using dexterous hands.Cogn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.030744Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:128773889acf542b34d45e2bd34a542f3077954e4da47152cde79ca1cd859e5b","observation_id":"6f1216af-6b17-4952-b576-49cb6f98da3a","resolution":{"observed_at":"2026-08-06T15:33:38.030744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:38.117746Z","title":"Human- like dexterous manipulation for anthropomorphic five-fingered hands: A review.Biomimetic Intelligence and Robotics, page 100212, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.117746Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f46b54fd1fcc117e902f56ce101cd133e260f531ae243c53b09bb4356b2ee7e0","observation_id":"213d718d-a32c-4af2-9165-83202181cc38","resolution":{"observed_at":"2026-08-06T15:33:38.117746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T15:33:38.186546Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.186546Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:bb0e5a2d8b82ea68db369efa07ed475c19d3d5356341c7e0362228898b85376e","observation_id":"7fba0bd0-220a-4636-88c9-994dbfdec581","resolution":{"observed_at":"2026-08-06T15:33:38.186546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T15:33:38.258306Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.258306Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:b74f8b6cf3701a6e50caa1c4bd7ad6be0e44df8ebea9a67280f31781b0cacd0f","observation_id":"6a33fae2-b40e-46a0-9aa4-30f4344c74ec","resolution":{"observed_at":"2026-08-06T15:33:38.258306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T15:33:38.333345Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.333345Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:d891cec22091ee55276e17a2a44148d890f9ec5dbd481abb8d92591f5bb9e9b9","observation_id":"c761ec84-fc8d-4f83-90a1-a10fa9f9c1b3","resolution":{"observed_at":"2026-08-06T15:33:38.333345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T15:33:38.444159Z","title":"corr, abs/2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.444159Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:6fe7b8400ef20bed19003c47cc3eb3398e6b99defeed31eb2ca1eb36ca695dd1","observation_id":"fd76e2bb-41aa-4466-9b3b-2a46499d2114","resolution":{"observed_at":"2026-08-06T15:33:38.444159Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-06T15:33:38.504555Z","title":"A survey on vision-language-action models for embodied ai.arXiv preprint arXiv:2405.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.504555Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:26225dc8b8e206bca47284ca3e5cc25f98f4c987fd84a41d9eb98d17a0bda2d5","observation_id":"c3755938-f091-4b94-bf74-424a6f6857db","resolution":{"observed_at":"2026-08-06T15:33:38.504555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:38.565294Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.565294Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:cd8b72acc643a4fbc4a1c6a7bec98a42f23bda9330001adf2fb2f536f56b0a1a","observation_id":"083d9651-4bab-4508-bd8c-d5c12ae2c2ce","resolution":{"observed_at":"2026-08-06T15:33:38.565294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-06T15:33:38.669232Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.669232Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:60508dd698cf4ad7f568185a335abfc1c4a498244355ccc8f0a06dd13dbf5672","observation_id":"0167b96c-8cbb-478e-8f81-72518a88ed38","resolution":{"observed_at":"2026-08-06T15:33:38.669232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-06T15:33:38.782713Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.782713Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:5437f29cbd060aca324175800f95f2e0f501297c39d98cfe14e2f3e18d64aa9c","observation_id":"15bf4cc7-8ccd-4bf6-85d5-88b7d152e3ca","resolution":{"observed_at":"2026-08-06T15:33:38.782713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T15:33:38.850217Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.850217Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f475678804b8fb1e1b052263360cabd9d03d0f84035bca48cb1a4f986aa43cf0","observation_id":"d16fe479-8fab-4ff1-bafc-196a245d4018","resolution":{"observed_at":"2026-08-06T15:33:38.850217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14747","last_updated":"2024-08-27T02:52:15Z","snapshot_observed_at":"2026-08-12T22:56:56.907136Z","submitted_at":"2024-08-27T02:52:15Z","title":"Benchmarking Reinforcement Learning Methods for Dexterous Robotic Manipulation with a Three-Fingered Gripper","version":1},"cited_work":{"arxiv_id":"2408.14747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14747","snapshot_observed_at":"2026-08-06T15:33:52.196422Z","title":"Benchmarking Reinforcement Learning Methods for Dexterous Robotic Manipulation with a Three-Fingered Gripper","venue":"cs.RO","work_id":"7ffd0bfd-b94c-4ac9-8ef5-86dffee09b0a","year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.935193Z"},"links":{"cited_paper":"/paper/2408.14747","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:d7ce9329d13272e2e26dd574c19d818def99bd5aade0986b1e8bb23d9fba9720","observation_id":"f6b63b9f-f0e5-4395-9dc3-3f997dcb7cb8","resolution":{"observed_at":"2026-08-06T15:33:52.228371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.037596Z","title":"Dexterous manipulation through imitation learning: A survey.arXiv preprintarXiv:2504.03515, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.037596Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c0ff2ae896641102fa1cd0bb8121acd382795990295b44fa54c0ca1caac4b656","observation_id":"85fbd045-d31a-4aeb-8290-96b34abab5cf","resolution":{"observed_at":"2026-08-06T15:33:39.037596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05821","last_updated":"2024-12-08T06:54:43Z","snapshot_observed_at":"2026-08-12T22:08:01.135104Z","submitted_at":"2024-11-04T18:01:34Z","title":"Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05821","snapshot_observed_at":"2026-08-06T15:33:39.082418Z","title":"Benchmarking vision, language, & action models on robotic learning tasks.arXiv preprint arXiv:2411.05821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.082418Z"},"links":{"cited_paper":"/paper/2411.05821","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:01e052ba431087cccf3a058b6254b71b038e1a3bee499cf4e7db7bf0971ac5cf","observation_id":"9ca9382e-bac0-4847-b679-5c588f9d4f30","resolution":{"observed_at":"2026-08-06T15:33:39.082418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.147164Z","title":"Scaffolding dexterous manipulation with vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.147164Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:518c250322a1703c6d5d6dea614defb16082f6a35254aad7d8bbd88978251c1d","observation_id":"491785a3-b285-43a1-84bd-44dd8f44e829","resolution":{"observed_at":"2026-08-06T15:33:39.147164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.204910Z","title":"Unidexgrasp: Universal robotic dexterous grasping via learning diverse proposal generation and goal-conditioned policy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.204910Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:90d5d3bb36fec09077c970a9212ad86be15e891be9aea2296a26e845674460c4","observation_id":"184e660e-cae0-459c-a0b8-4082e56b2734","resolution":{"observed_at":"2026-08-06T15:33:39.204910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.260785Z","title":"Unidexgrasp++: Improving dexterous grasping policy learning via geometry-aware curriculum and iterative generalist-specialist learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.260785Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4535555c19a9a75fcd173bd2d7964bb1f11868191f30de3b44302c1c27158ef1","observation_id":"6029deac-11f4-4de2-8f49-475f5190838a","resolution":{"observed_at":"2026-08-06T15:33:39.260785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.321889Z","title":"Dexgraspvla: A vision-language-action framework towards general dexterous grasping.arXiv preprint arXiv:2502.20900, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.321889Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:192e5f52debe5d7a4cad19142567c95286b83ccc6c1d8b0b1775f20de38eb7dd","observation_id":"9012a185-501a-4aa7-b078-aa123dc4d97a","resolution":{"observed_at":"2026-08-06T15:33:39.321889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02747","last_updated":"2025-07-03T16:05:25Z","snapshot_observed_at":"2026-08-14T05:54:08.465536Z","submitted_at":"2025-07-03T16:05:25Z","title":"DexVLG: Dexterous Vision-Language-Grasp Model at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02747","snapshot_observed_at":"2026-08-06T15:33:39.445246Z","title":"Dexvlg: Dexterous vision-language-grasp model at scale.arXiv preprint arXiv:2507.02747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.445246Z"},"links":{"cited_paper":"/paper/2507.02747","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:b0283c098780b761e3f672348f954fd3eb1c2f7b6ca03e8013bd394b12d94244","observation_id":"9c96aaab-977f-4a81-9243-af342b15fcf0","resolution":{"observed_at":"2026-08-06T15:33:39.445246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.511611Z","title":"Efficient residual learning with mixture-of-experts for universal dexterous grasping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.511611Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:ed07f3bb143278b85253bb39430666dfe63e72ccbab44c8d8ddee18144040caa","observation_id":"ddc36849-c43d-428b-b6ad-a01e4bd224c4","resolution":{"observed_at":"2026-08-06T15:33:39.511611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-06T15:33:39.565406Z","title":"R3m: A universal visual representation for robot manipulation.arXiv preprint arXiv:2203.12601, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.565406Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:90a0f42344d497fc6ec0a29551450cdd1d05ce2f3bafd0165912783f2ebcbb26","observation_id":"13d52d96-73ba-4d36-b6ac-1a52ae2cc874","resolution":{"observed_at":"2026-08-06T15:33:39.565406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.683285Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.683285Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c0a63a02cc7f94e01d8568b9bcf14ed8507f7cdc660ff3d773e8fcc99ae861ac","observation_id":"1c462fb1-22bf-4e43-905f-15c05c20b67a","resolution":{"observed_at":"2026-08-06T15:33:39.683285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-06T15:33:39.742191Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.742191Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:ba5fc491995c8bed3fd81097d10179ec4fd217769fa948dc62268d93ca491a1d","observation_id":"135da890-1f3d-4ffa-a1a0-76593fa951cf","resolution":{"observed_at":"2026-08-06T15:33:39.742191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.817847Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.817847Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:17ea626d21f8f39d7be0652cd1b012076150414e7ddc3a863ad0aa561fa1bafb","observation_id":"d704d37f-98f8-4199-a36d-79442114c205","resolution":{"observed_at":"2026-08-06T15:33:39.817847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.886667Z","title":"Humanoid policy˜ human policy.arXiv preprint arXiv:2503.13441, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.886667Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:108a3b5204b6e5e3f3558036090a47e17739cfdc59708347b18804c2b03caba7","observation_id":"2097f02f-9b4a-4ef1-aa62-ffc549579545","resolution":{"observed_at":"2026-08-06T15:33:39.886667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:39.964864Z","title":"Integrated linkage-driven dexterous anthropomorphic robotic hand.Nature communications, 12(1):7177, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:39.964864Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f51655fa3b5a29b35a195b35e49f683d33b5544e8577a8529ff62f512c07fe89","observation_id":"741b91a3-801d-4279-96aa-da1d43cc7a09","resolution":{"observed_at":"2026-08-06T15:33:39.964864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.066734Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.066734Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c33621f7eb0f8514f19dbe1e3959450485cca3f0ef35d7f7e3630d789e28161a","observation_id":"e8b02f06-166e-421e-ad27-2187dbe4f505","resolution":{"observed_at":"2026-08-06T15:33:40.066734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.128808Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.128808Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:a44ad413f4143eed15a2c361da427e4fd87ee56be336115edf7458cb5648e61f","observation_id":"19f3022c-e89f-4ee9-bf75-12b6dc9d4e00","resolution":{"observed_at":"2026-08-06T15:33:40.128808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-13T11:49:24.433450Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-06T15:33:40.225699Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec.arXiv preprint arXiv:2305.02765, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.225699Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:a0928ec6ee19fce53b7f972ea11b782876aa946d48aefa107dd49aa8886096e2","observation_id":"acbb01f9-ab9e-405a-9aaf-dc55f47d8d26","resolution":{"observed_at":"2026-08-06T15:33:40.225699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.309722Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.309722Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:fe4e7d9327cdef5033ce221200d8f125165d7f55cb16f994dc4733b66d0ffca3","observation_id":"2ea0e8ec-bf17-403b-accf-af76bacde7dc","resolution":{"observed_at":"2026-08-06T15:33:40.309722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.390951Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.390951Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f638d9d8d2000042aa3636519f1e4c1f7d7105c3c29551f16d92a3ed8f8efe37","observation_id":"1988342e-245c-4e46-b539-17e5a62fccee","resolution":{"observed_at":"2026-08-06T15:33:40.390951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.524143Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.524143Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:d2865ed4383dc40d1a0624038877975e9cf3e0acd8cf3f8d5ca83dafb65b3e27","observation_id":"5ed2d5c7-ac6d-4597-bfd7-852ab5fb44e2","resolution":{"observed_at":"2026-08-06T15:33:40.524143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:40.627678Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.627678Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:530f1d87a504658f58a14981d2e9a35d3993964fd0390fc0e208c35af076946a","observation_id":"97e4cffd-b982-4108-a1c4-743565f197b9","resolution":{"observed_at":"2026-08-06T15:33:40.627678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T15:33:40.742365Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.742365Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:2aa1ffc2407e213154a6bf1f73056f7b8bcd0f51105cf1b18876e6187057e9a2","observation_id":"60782969-dfa1-4753-9d7f-d8d02d600f00","resolution":{"observed_at":"2026-08-06T15:33:40.742365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T15:33:40.877665Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.877665Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:8d96702bb69f4098f089e17789f0663591a5263ced58ccba09f04aebfb5614f7","observation_id":"4374b8c0-d9c7-49ff-b2cb-24044a597685","resolution":{"observed_at":"2026-08-06T15:33:40.877665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09072","last_updated":"2024-03-14T03:29:58Z","snapshot_observed_at":"2026-08-13T00:54:38.897464Z","submitted_at":"2024-03-14T03:29:58Z","title":"UniCode: Learning a Unified Codebook for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.09072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09072","snapshot_observed_at":"2026-08-06T15:33:51.834697Z","title":"UniCode: Learning a Unified Codebook for Multimodal Large Language Models","venue":"cs.CV","work_id":"9429ca83-bf0a-4d42-95b3-8bc891500a4f","year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:40.966946Z"},"links":{"cited_paper":"/paper/2403.09072","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:7abee3d922a9def9c5e2a49f7c30a4ab068e9091e717eb920b8ed86ef77ffeda","observation_id":"8c0f0ddd-94f6-4668-a86d-3723dcc5bfa3","resolution":{"observed_at":"2026-08-06T15:33:51.856771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.028548Z","title":"From pixels to tokens: Byte-pair encoding on quantized visual modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.028548Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:8c55c861055a167734e0954643418dd75f33611488b4a237b80837541d11f192","observation_id":"deb167aa-01ee-46b0-9fbd-898b7204f23c","resolution":{"observed_at":"2026-08-06T15:33:41.028548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.136954Z","title":"Unified multimodal understanding via byte-pair visual encoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.136954Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:79fdf894b79b193d1c577142ce4868ba4fbc7f75c052f0a923bc10fc709b72bf","observation_id":"adf0c352-4347-4667-bd28-45f795d9c910","resolution":{"observed_at":"2026-08-06T15:33:41.136954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T15:33:41.212733Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.212733Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:210c3b2d9540abbd465f849264a58bc39caf9a7b73242afd5038a3f46fe4521c","observation_id":"066c0331-e95b-4295-b5a3-562d86f09264","resolution":{"observed_at":"2026-08-06T15:33:41.212733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T15:33:41.297194Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.297194Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:656d1b711793de151fddd41f4b923f07cb59f80dbf3768fc256f1637b50527af","observation_id":"0342fd5e-004f-42f7-ac47-d2370206bec7","resolution":{"observed_at":"2026-08-06T15:33:41.297194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T15:33:41.390792Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.390792Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:431d27d310d5651fceb4e95f7d70668f7b51ed4adfda3c99733f58c182ecd2be","observation_id":"ad47a498-55cc-41c1-8ab6-3ddd7213b88d","resolution":{"observed_at":"2026-08-06T15:33:41.390792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.519049Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.519049Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c43b1c5af374af91cf4f4a371a5610f8fb0919bcf2bcf439f74132ac111ebca3","observation_id":"16384af9-1a5c-4ebf-8af8-82e3d0a36ef1","resolution":{"observed_at":"2026-08-06T15:33:41.519049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.612755Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.612755Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:fef3271f9bf4ad44728e03a9537aa2bc3b3b82d7efdd25aee6cf2cf933966593","observation_id":"4aa01e2e-e516-487d-b31b-24f3b03e132d","resolution":{"observed_at":"2026-08-06T15:33:41.612755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.653621Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.653621Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:79d74e56b9276af222399b33ac84549389ba6e3165bf4735e8d97a1ef313f135","observation_id":"795e4fc5-e425-4936-b631-b248f5c0f6af","resolution":{"observed_at":"2026-08-06T15:33:41.653621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09958","last_updated":"2023-09-18T17:30:46Z","snapshot_observed_at":"2026-08-13T10:10:39.691607Z","submitted_at":"2023-09-18T17:30:46Z","title":"An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09958","snapshot_observed_at":"2026-08-06T15:33:41.744204Z","title":"An empirical study of scaling instruct-tuned large multimodal models.arXiv preprint arXiv:2309.09958, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.744204Z"},"links":{"cited_paper":"/paper/2309.09958","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:7c5f2a7610ee9448bfe689c58ebbbb940329b1ca580c882754b2a8089b5453e4","observation_id":"73eea413-02bd-4805-9e29-ebe6079d4b4b","resolution":{"observed_at":"2026-08-06T15:33:41.744204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T15:33:41.848263Z","title":"Ferret: Refer and ground anything anywhere at any granularity.arXiv preprint arXiv:2310.07704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.848263Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:9d3c0b4c3c2e245fa41918761a262cbe81fdf2a8a5425482ab44d97573d3ad20","observation_id":"4e4c7e95-305b-4de5-a648-8eb8351a6023","resolution":{"observed_at":"2026-08-06T15:33:41.848263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:41.991890Z","title":"Otter: A multi-modal model with in-context instruction tuning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:41.991890Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:d1061714b91c85f14ce7f9b03ec38d3b3f2d94a1b3e2c277e04afda435f09e46","observation_id":"2c79e090-2cd3-4c00-8792-c604cdfd504e","resolution":{"observed_at":"2026-08-06T15:33:41.991890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T15:33:42.059251Z","title":"Allava: Harnessing gpt4v-synthesized data for lite vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.059251Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:af9d0d88dfbc5142f9431b9a11191dc2bab81c7d4f03233566b1da4b2a3c3c9b","observation_id":"ae659049-9bdc-4c7c-a9a9-ae018ab13db5","resolution":{"observed_at":"2026-08-06T15:33:42.059251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13255","last_updated":"2023-12-07T05:36:26Z","snapshot_observed_at":"2026-08-13T05:44:54.851617Z","submitted_at":"2023-10-20T03:22:05Z","title":"Steve-Eye: Equipping LLM-based Embodied Agents with Visual Perception in Open Worlds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13255","snapshot_observed_at":"2026-08-06T15:33:42.174500Z","title":"Steve-eye: Equipping llm-based embodied agents with visual perception in open worlds.arXiv preprint arXiv:2310.13255, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.174500Z"},"links":{"cited_paper":"/paper/2310.13255","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:44ada4430eb052936b68c8cda977f8ad255aa552924fd8f6c1d9801ce62bd7f2","observation_id":"27a8bc03-cdfb-4104-b4c7-46b0ec370c46","resolution":{"observed_at":"2026-08-06T15:33:42.174500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16156","last_updated":"2025-03-18T08:15:28Z","snapshot_observed_at":"2026-08-12T17:08:14.215814Z","submitted_at":"2024-11-25T07:32:02Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","version":2},"cited_work":{"arxiv_id":"2411.16156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16156","snapshot_observed_at":"2026-08-06T15:33:51.653731Z","title":"VideoOrion: Tokenizing Object Dynamics in Videos","venue":"cs.CV","work_id":"3a2b9abd-e110-4484-bac3-2c95c835e65a","year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.245773Z"},"links":{"cited_paper":"/paper/2411.16156","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:aec7c783580032ebf9ddbe2849a1d7e097ed87c0b7847fd7b4c37bc83ee773a7","observation_id":"dc1b8b98-c779-4bba-ba14-eacaaf7e8583","resolution":{"observed_at":"2026-08-06T15:33:51.694013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07002","last_updated":"2025-03-10T07:32:53Z","snapshot_observed_at":"2026-08-14T07:47:06.608743Z","submitted_at":"2025-03-10T07:32:53Z","title":"Taking Notes Brings Focus? Towards Multi-Turn Multimodal Dialogue Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07002","snapshot_observed_at":"2026-08-06T15:33:42.364931Z","title":"Taking notes brings focus? towards multi-turn multimodal dialogue learning.arXiv preprint arXiv:2503.07002, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.364931Z"},"links":{"cited_paper":"/paper/2503.07002","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:fba47c5eadb04b2f614bd1730b63189518dea1f92f0f94ba3fd6a882cc300d68","observation_id":"38d25635-d466-4879-9c91-7c7a075b8501","resolution":{"observed_at":"2026-08-06T15:33:42.364931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T15:33:42.485380Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.485380Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:ad4301173b346fab7ffd7abb6e03cce5f1fd82a11f7c1ad471777f9ea4df8e30","observation_id":"f2b40deb-04fd-4eac-9224-ba01623ceca6","resolution":{"observed_at":"2026-08-06T15:33:42.485380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-06T15:33:42.589633Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.589633Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:701850fa2113e8bf2631e0c2a01aba536dbec3b7c3011c9f91ad8d7703e32494","observation_id":"4144850f-7008-4400-b3f4-71b67d53e5f1","resolution":{"observed_at":"2026-08-06T15:33:42.589633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:33:42.732915Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.732915Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4fb3383b8d7f4a41215f792415cf8e36a8c32ff246010564bb1ae0f8140a2977","observation_id":"7303ebdd-6754-4c31-abb3-8adc9def0a10","resolution":{"observed_at":"2026-08-06T15:33:42.732915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T15:33:42.826045Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.826045Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:5a4fad933cf78c956cc4fd7ddd9ca9df04f6a8a1073a476e8737afe7a9ffaa51","observation_id":"0d05e1ec-5676-4ae6-8442-5ff22a4731f8","resolution":{"observed_at":"2026-08-06T15:33:42.826045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T15:33:42.934724Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:42.934724Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:3d59b7f1ad250d84e96cecada52b1436db1812d55e69658d2919f4483bcd1eb6","observation_id":"2359026e-9846-4af3-baa0-3e9031579db4","resolution":{"observed_at":"2026-08-06T15:33:42.934724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T15:33:43.026591Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.026591Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:d6168efbfe901b252f582cdf0aee65f4d91d99aab0457aaaecab273d50b5e94e","observation_id":"bdbd68bd-fb7c-474d-b25b-d70e32d48fb4","resolution":{"observed_at":"2026-08-06T15:33:43.026591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.146808Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models.arXiv e-prints, pages arXiv–2409, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.146808Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:28cd646928620d20093063b48c67e90903dfabe7403f00e18cf2f55b67be5f76","observation_id":"d9fe530f-52cd-4c1a-99ab-7acedadf48b7","resolution":{"observed_at":"2026-08-06T15:33:43.146808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.239350Z","title":"The kit motion-language dataset","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.239350Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:e7523e46ad98244e3c7d0329c2f5756908535e9ea3ce1babf9114709d24cca50","observation_id":"edecf294-eb4f-4955-bde3-9c9d01281c77","resolution":{"observed_at":"2026-08-06T15:33:43.239350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.309159Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.309159Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:dbd3335aa401d9405f394b7e0fd81b40b35cb22d7f02020272f3b8e966337c19","observation_id":"6faaf8af-74e8-4ad0-a2a7-ccd77fdca5b5","resolution":{"observed_at":"2026-08-06T15:33:43.309159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.383085Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.383085Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f013f5f180300434b862ef2e68643300e61a4f2a52329bd4ae8103f76e60414d","observation_id":"d53026f1-1d85-4640-81e7-8aba6ff3d6ff","resolution":{"observed_at":"2026-08-06T15:33:43.383085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.482132Z","title":"Babel: Bodies, action and behavior with english labels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.482132Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:9d8432f41c6da85f2e2a83aae93a1437d784d7205c24074e3295a6814e2bd4db","observation_id":"60971193-2d7b-4864-a387-f741b9783ea8","resolution":{"observed_at":"2026-08-06T15:33:43.482132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.571970Z","title":"Motion-x: A large-scale 3d expressive whole-body human motion dataset.Advances in Neural Information Processing Systems, 36:25268–25280, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.571970Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:cd6641eedd1748c4e430d707e91a9c8dd05af16e7c19edc0e2245740c301497c","observation_id":"5ee93827-7900-4bec-87d3-aa21d56eef54","resolution":{"observed_at":"2026-08-06T15:33:43.571970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.663928Z","title":"Egobody: Human body shape and motion of interacting people from head-mounted devices","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.663928Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4c35d0cd7bd6d068dfb55b3b9ad7abc0a36392d29c336194d3b96fe3c6278dcb","observation_id":"1e470422-15ee-460f-a820-a5e001100406","resolution":{"observed_at":"2026-08-06T15:33:43.663928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.756773Z","title":"Nymeria: A massive collection of multimodal egocentric daily motion in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.756773Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:346ed966aae749b5f6b239e608bdabf1cb9b68314c966d1c13438946c6c3a8af","observation_id":"18c5d703-6a66-4c4d-aba1-7872741a2f59","resolution":{"observed_at":"2026-08-06T15:33:43.756773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.859592Z","title":"Scaling large motion models with million-level human motions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.859592Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:eb7d30d82a64f44bc0fd284c6844c50d2c247eaa88636e7249366e46a06c44dd","observation_id":"5a028043-3caf-45a2-948c-f1761def8109","resolution":{"observed_at":"2026-08-06T15:33:43.859592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:43.946231Z","title":"Smpl: A skinned multi-person linear model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:43.946231Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:972ba2497deb89a34cae02456b69abdafa905d29d908f5d6b5de453bf98e85b1","observation_id":"9e5e0376-e134-4548-85f5-bed4f8b76961","resolution":{"observed_at":"2026-08-06T15:33:43.946231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.086686Z","title":"Expressive body capture: 3d hands, face, and body from a single image","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.086686Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:17f786fbb32c4b8d3f4bcc9fff6b09eeab8c2edc89c09a3958f1bbda26f948ef","observation_id":"8bfadaba-b22d-4fbc-9e10-e9213c25b9d1","resolution":{"observed_at":"2026-08-06T15:33:44.086686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-08-12T18:48:37.916493Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-08-06T15:33:44.187290Z","title":"Human motion diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.187290Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:e831308eae66f8d5bcb12642a678471a87660ca3bc37f19154e565b5cc304fbd","observation_id":"1d7f0419-75a2-4b7a-8313-4339200e13ea","resolution":{"observed_at":"2026-08-06T15:33:44.187290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.341154Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model.IEEE transactions on pattern analysis and machine intelligence, 46(6):4115–4128, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.341154Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f4289b88b67d1d336543444d115fc1e4c728cf016bbdbe8d119f0c596b35c6be","observation_id":"f64da1b0-6537-49c6-ad33-c267df7b40fb","resolution":{"observed_at":"2026-08-06T15:33:44.341154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.449291Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.449291Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:0f6acfcccdbe16325cd9e55cd69b2dfbd3115d9d121c6621cc70ea755dd47b36","observation_id":"b1483f9c-a7ff-4d5e-9aaf-a978a0a6bfe8","resolution":{"observed_at":"2026-08-06T15:33:44.449291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.595272Z","title":"Physdiff: Physics-guided human motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.595272Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:017ab78ac10ac5c25e6263044e47824c9e8bcc6c82ee61b0f158fb8613858d9b","observation_id":"4e06db4b-fddb-477f-9953-fcfc76856df7","resolution":{"observed_at":"2026-08-06T15:33:44.595272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.691840Z","title":"Remodiffuse: Retrieval-augmented motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.691840Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:fe57e8578313c6c523b2cdaea0cc6a90b23259ddeacc72163b35e65148514e63","observation_id":"0acc39f5-fa8f-453b-8df1-d67450ec27dd","resolution":{"observed_at":"2026-08-06T15:33:44.691840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01372","last_updated":"2023-09-04T05:43:48Z","snapshot_observed_at":"2026-08-13T20:51:36.315470Z","submitted_at":"2023-09-04T05:43:48Z","title":"DiverseMotion: Towards Diverse Human Motion Generation via Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01372","snapshot_observed_at":"2026-08-06T15:33:44.817249Z","title":"Diversemotion: Towards diverse human motion generation via discrete diffusion.arXiv preprint arXiv:2309.01372, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.817249Z"},"links":{"cited_paper":"/paper/2309.01372","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:13a852952bd6dc4c59c6b1a36a1177174fe249d8dd41ae4f0bc30f5cb72df3d4","observation_id":"59819418-f3cb-4b2b-a203-e1ee2f99d6bc","resolution":{"observed_at":"2026-08-06T15:33:44.817249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:44.965632Z","title":"Large motion model for unified multi-modal motion generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:44.965632Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:c688c502cac2b0b5a5ac92207c19292b80aa3ba72f9143cc8c00b540cc04c826","observation_id":"682795f0-2e56-4979-9ad7-04e47722f7b2","resolution":{"observed_at":"2026-08-06T15:33:44.965632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.087540Z","title":"Neural discrete representation learning.Advancesinneuralinformation processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.087540Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:660057fc6387d491c75bd165948b0059df5ce4dd0f56c14f4ba01e516c48f5c5","observation_id":"3781b643-41af-4e61-9e88-dfb34367abfe","resolution":{"observed_at":"2026-08-06T15:33:45.087540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.136041Z","title":"Generating human motion from textual descriptions with discrete representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.136041Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:a346e241580976c97ca39a391367417e7c14c395ad87ee3e70add4b4620c9afc","observation_id":"f2ca6c3c-e873-4be6-8e5a-76ab3fc3d47e","resolution":{"observed_at":"2026-08-06T15:33:45.136041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.196778Z","title":"Momask: Generative masked modeling of 3d human motions","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.196778Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:f07ea5d2aa96a3e88172f926b4d1315e255269cfe497226249a9f69827478914","observation_id":"faaf87c1-c4a7-4048-ae4f-ba422cd2cc71","resolution":{"observed_at":"2026-08-06T15:33:45.196778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.323096Z","title":"Locally hierarchical auto-regressive modeling for image generation.Advances in Neural Information Processing Systems, 35:16360–16372, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.323096Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:741ea611f59a3889cdc05f59c106db86905bd7514b227526ca848aa14c4d09f9","observation_id":"a6c50ce6-706c-492e-82a5-fb1296c08074","resolution":{"observed_at":"2026-08-06T15:33:45.323096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12978","last_updated":"2023-10-19T17:59:46Z","snapshot_observed_at":"2026-08-13T11:56:19.737423Z","submitted_at":"2023-10-19T17:59:46Z","title":"HumanTOMATO: Text-aligned Whole-body Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12978","snapshot_observed_at":"2026-08-06T15:33:45.392908Z","title":"Humantomato: Text-aligned whole-body motion generation.arXiv preprint arXiv:2310.12978, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.392908Z"},"links":{"cited_paper":"/paper/2310.12978","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:44272171e70215580f6b859a467208ed3e4151c6890390fa70f34006c531629a","observation_id":"cabb6102-fbb4-441b-a064-d4dd6e18247c","resolution":{"observed_at":"2026-08-06T15:33:45.392908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T15:33:45.489989Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.489989Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:1368c5100b0f107698ebc8336239166effc564e8121101e79bdaa7aab233067c","observation_id":"9fde13bd-7364-46ce-a8b4-bf498e37734b","resolution":{"observed_at":"2026-08-06T15:33:45.489989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T15:33:45.572085Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.572085Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:dec2bf1f8faf2c6d0018890750daa9482adeda412c98434dcab4b2948d1598d0","observation_id":"42a3761b-fb1e-4cd7-9020-57caeba12fd1","resolution":{"observed_at":"2026-08-06T15:33:45.572085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.640936Z","title":"Motiongpt: Human motion as a foreign language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.640936Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4c08e8625b8e12154ac90ba68d63edd24e232c4367674ae34c1e995a76d14fdf","observation_id":"c9e1c9c6-8b7c-45e9-8f6f-66736c3c6272","resolution":{"observed_at":"2026-08-06T15:33:45.640936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-08-12T22:13:07.514751Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-06T15:33:45.729880Z","title":"Motiongpt-2: A general-purpose motion-language model for motion generation and understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.729880Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:bb1cd1e932c7fdb345a513905a6942e07dd4a1413a7f805d9e3d505ca8b28ee8","observation_id":"df7acbec-d0c8-4121-9b14-ad743b74c024","resolution":{"observed_at":"2026-08-06T15:33:45.729880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-14T13:54:28.489740Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-06T15:33:45.839617Z","title":"Motionllm: Understanding human behaviors from human motions and videos.arXiv preprint arXiv:2405.20340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.839617Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:11a0e27c6314efdf19c61e32e89c96e98b6619772c0bf971879a4ae03c771129","observation_id":"f7cd73b6-a9aa-41d4-97c9-144cc1f960c5","resolution":{"observed_at":"2026-08-06T15:33:45.839617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:45.967329Z","title":"Avatargpt: All-in-one framework for motion understanding planning generation and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:45.967329Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:4e77020b9d64c8c70aa5b0f948822f730c60ac5361779d55c51b6b22a6be91f2","observation_id":"bfed5262-2915-4001-b16e-cc2be9cb474e","resolution":{"observed_at":"2026-08-06T15:33:45.967329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.024326Z","title":"Motionchain: Conversational motion controllers via multimodal prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.024326Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:17f59dfcb092f505ba7ba4e4291a7f4406561743d17b3987f6bdf56f7b7e7927","observation_id":"ba2656d6-4ed0-42c8-92a0-fb815962cbee","resolution":{"observed_at":"2026-08-06T15:33:46.024326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07093","last_updated":"2025-03-08T06:09:23Z","snapshot_observed_at":"2026-08-12T22:27:00.610689Z","submitted_at":"2024-10-09T17:33:03Z","title":"LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07093","snapshot_observed_at":"2026-08-06T15:33:46.059708Z","title":"Lamp: Language-motion pretraining for motion generation, retrieval, and captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.059708Z"},"links":{"cited_paper":"/paper/2410.07093","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:8953f91b6f08016bf011e84ce2bde02e6e448266470330bf350c6af4fdfe307f","observation_id":"e9b8a8fc-126e-426a-913b-64b2385a169d","resolution":{"observed_at":"2026-08-06T15:33:46.059708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.130864Z","title":"Human motion instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.130864Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:25b0f3655adee91bd49984f8e524d086bddd27d30631d222fb8e769a5de0a613","observation_id":"5d245ff8-9b14-45cf-bd77-9f159ac67b35","resolution":{"observed_at":"2026-08-06T15:33:46.130864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12769","last_updated":"2025-06-15T08:39:49Z","snapshot_observed_at":"2026-08-09T22:12:27.434429Z","submitted_at":"2025-06-15T08:39:49Z","title":"RL from Physical Feedback: Aligning Large Motion Models with Humanoid Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12769","snapshot_observed_at":"2026-08-06T15:33:46.196891Z","title":"Rl from physical feedback: Aligning large motion models with humanoid control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.196891Z"},"links":{"cited_paper":"/paper/2506.12769","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:2bc013cb6727b5fe1c720f391dae6b481667e653a666fe6c4bdc3fbe0166dc0b","observation_id":"8a7212e1-8afc-45b2-a49d-cba95fb4f3e0","resolution":{"observed_at":"2026-08-06T15:33:46.196891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.255945Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.255945Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:2a115762cc2057cf90dc2daf9fc3e015a3ac6f2f6ce122abfa4d9cb7638d7fa5","observation_id":"4a9fdfc3-20bd-4aa5-a976-0eb87aef1e2c","resolution":{"observed_at":"2026-08-06T15:33:46.255945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13196","last_updated":"2025-03-12T00:40:43Z","snapshot_observed_at":"2026-08-11T13:17:42.993482Z","submitted_at":"2024-12-17T18:59:51Z","title":"ExBody2: Advanced Expressive Humanoid Whole-Body Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13196","snapshot_observed_at":"2026-08-06T15:33:46.336690Z","title":"Exbody2: Advanced expressive humanoid whole-body control.arXiv preprint arXiv:2412.13196, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.336690Z"},"links":{"cited_paper":"/paper/2412.13196","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:d63bb9d45ba5e7afafc8c3aca2655a0d1ae7889d0f9a5a92e0331ac637f20b7b","observation_id":"2b6f6754-fb9c-4da2-ac3d-db188e302e23","resolution":{"observed_at":"2026-08-06T15:33:46.336690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.386963Z","title":"Reindiffuse: Craft- ing physically plausible motions with reinforced diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.386963Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:cbccd0ff612ffb66790fd6c5eb8835d65d0fa64229aa073d92a97a79a0ef116f","observation_id":"6dad6a80-a450-43de-b8e7-b6141c91e102","resolution":{"observed_at":"2026-08-06T15:33:46.386963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.451798Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.451798Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:9af2d11fef3ba2230359add6468cf49e552926fc3c4816462d8cc155f07976c9","observation_id":"ae8d7db9-e877-4a54-8368-084b19507e00","resolution":{"observed_at":"2026-08-06T15:33:46.451798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.508374Z","title":"Hand-object contact consistency reasoning for human grasps generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.508374Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:ad800f5c04c3989a4069cce58a9b9307df74f135ac371f6b33e0b4a62e4683d9","observation_id":"900fbd39-23f3-426f-9049-b2f95871ed97","resolution":{"observed_at":"2026-08-06T15:33:46.508374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.541539Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.541539Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:5c5ce57bf5e54c3324369f8d696056898f70b910e721f75eb336d15107f1fc47","observation_id":"91a3701f-955f-4d51-b7f4-43fe3e148d98","resolution":{"observed_at":"2026-08-06T15:33:46.541539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.564839Z","title":"Hot3d: Hand and object tracking in 3d from egocentric multi-view videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.564839Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:415a315276a395efde059ede696b76c0c8fefe55ca0f5dfaf919cacb72456a13","observation_id":"079824de-be87-4b1b-97ba-a373f732fc17","resolution":{"observed_at":"2026-08-06T15:33:46.564839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.641803Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.641803Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:74ec1fc0dbc5ae8093d4b9a0bde50d25ce3b649f31dcc7fd84848ab603ef3a4a","observation_id":"b19ece4c-6d3d-4fda-867d-6e11e371444c","resolution":{"observed_at":"2026-08-06T15:33:46.641803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.644330Z","title":"Oakink2: A dataset of bimanual hands-object manipulation in complex task completion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.644330Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:1b7f908328e53b3a736856a8848f5f5dcdfc1b61b33bc55a988f9d0f25016f08","observation_id":"e9bcd271-54de-4248-a716-a2d7b3e2b4a0","resolution":{"observed_at":"2026-08-06T15:33:46.644330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:33:46.663820Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:46.663820Z"},"links":{"citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:3f5fe17ade2482677bdfdf9b9dc93cb4dd6dbe69c4797933f2f243fa91153947","observation_id":"21d286b6-3268-443e-8562-e447361b5c5f","resolution":{"observed_at":"2026-08-06T15:33:46.663820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":161},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 161 outbound references and 63 inbound Pith citation observations for arXiv:2507.15597."}