{"as_of":"2026-08-08T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01bab5f0b1dfaee42835a7e4418f397c4aaf89bbd1ba2aec1200cdcfaaaf7550","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:59:56.340266Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:26:21.839155Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:59:55.584141Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"cited_work":{"arxiv_id":"2506.22827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22827","snapshot_observed_at":"2026-07-04T14:59:55.584141Z","title":"Hierarchical vision-language planning for multi-step humanoid manipulation.arXiv preprint arXiv:2506.22827, 2025","venue":null,"work_id":"c04913f3-5ab1-47b6-87f0-8831958b4e5e","year":2025},"citing_paper":{"arxiv_id":"2606.07723","last_updated":"2026-06-05T16:21:27Z","snapshot_observed_at":"2026-08-02T03:37:35.733251Z","submitted_at":"2026-06-05T16:21:27Z","title":"VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:00.330510Z"},"links":{"cited_paper":"/paper/2506.22827","citing_paper":"/paper/2606.07723"},"observation_digest":"sha256:30851f0f1714be8cff3a3e42597eaedb64ee15159dcdb2d3443fa9f926ecb5ff","observation_id":"a9371fa1-1616-44d4-bff4-09ea5ae26d81","resolution":{"observed_at":"2026-07-02T19:07:18.196604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"cited_work":{"arxiv_id":"2506.22827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22827","snapshot_observed_at":"2026-07-04T14:59:55.584141Z","title":"Hierarchical vision-language planning for multi-step humanoid manipulation.arXiv preprint arXiv:2506.22827, 2025","venue":null,"work_id":"c04913f3-5ab1-47b6-87f0-8831958b4e5e","year":2025},"citing_paper":{"arxiv_id":"2606.26201","last_updated":"2026-06-24T16:28:23Z","snapshot_observed_at":"2026-08-06T02:39:28.047556Z","submitted_at":"2026-06-24T16:28:23Z","title":"OmniContact: Chaining Meta-Skills via Contact Flow for Generalizable Humanoid Loco-Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T02:02:14.858734Z"},"links":{"cited_paper":"/paper/2506.22827","citing_paper":"/paper/2606.26201"},"observation_digest":"sha256:9a06010e3ce6c7f9160a038f964e03f05e62cad7f00f61b9ffe4f17ce4c139af","observation_id":"0775e951-af37-4281-8935-448110cc6792","resolution":{"observed_at":"2026-07-04T14:59:55.585553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22827","snapshot_observed_at":"2026-08-01T16:26:21.839155Z","title":"Schakkal, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18016","last_updated":"2026-07-26T09:19:57Z","snapshot_observed_at":"2026-08-06T22:43:38.582394Z","submitted_at":"2026-07-20T14:52:46Z","title":"Closing the Loop in Humanoid VLA: Persistent 3D Object Tokens for Verifiable Loco-Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T16:26:21.839155Z"},"links":{"cited_paper":"/paper/2506.22827","citing_paper":"/paper/2607.18016"},"observation_digest":"sha256:84c776e74acda353e2cf04b6d01498408e0a5c0d2d3ec8518c1fec58e05a2438","observation_id":"1236f92f-c8d7-4e0f-8607-e11f1936bf03","resolution":{"observed_at":"2026-08-01T16:26:21.839155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22827/citation-record","integrity":"/paper/2506.22827/integrity","json":"/paper/2506.22827/citation-record.json","paper":"/paper/2506.22827"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:52.553403Z","title":"Pddl| the planning domain definition language","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.553403Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:aad217cce95c28a58765482ed1d5e0e219e04c296064ccc8104536762f7d78db","observation_id":"6fb2cb8b-4321-48bb-bdb7-59189996548d","resolution":{"observed_at":"2026-08-06T21:59:52.553403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-06T21:59:52.602106Z","title":"RT-H: Action Hierarchies Using Language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.602106Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:fcdbfac59e7c2f53e3efc27331a41d2ffae0321caf4389ed6f494af39918c743","observation_id":"61c3af3c-568d-4eba-bff6-0c8e576d3da3","resolution":{"observed_at":"2026-08-06T21:59:52.602106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-06T21:59:52.680174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.680174Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:60635e072ed59d2230d945165f86d914c98c65a8e95e3f5bb0a2361f4e82bb92","observation_id":"954d7951-13ec-4c33-b96c-4a1416aeaa52","resolution":{"observed_at":"2026-08-06T21:59:52.680174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T21:59:52.757636Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.757636Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:cf01af7a7cca1a6862d6ebb994bb3d6cd583f47940e97f1c1ea102718050c8de","observation_id":"b90758fc-2740-4c65-bc18-a54882e36608","resolution":{"observed_at":"2026-08-06T21:59:52.757636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-06T21:59:52.812767Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.812767Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:dd0859596629a72f5b9e69c350e3dbf230d1549e1aeefa7625b48b6de47daafb","observation_id":"c7e8f828-9987-4e2f-887e-4330e5f0a59c","resolution":{"observed_at":"2026-08-06T21:59:52.812767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16796","last_updated":"2024-03-06T02:19:38Z","snapshot_observed_at":"2026-08-05T15:25:27.321156Z","submitted_at":"2024-02-26T18:09:24Z","title":"Expressive Whole-Body Control for Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16796","snapshot_observed_at":"2026-08-06T21:59:52.885794Z","title":"Expressive Whole-Body Control for Humanoid Robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.885794Z"},"links":{"cited_paper":"/paper/2402.16796","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:981e4b892da33e06b1bcf47c18ad39e3b69e9186a651f8ea7f6b923c591ba744","observation_id":"df44942e-909d-4459-8cb2-fe32739980ea","resolution":{"observed_at":"2026-08-06T21:59:52.885794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:00:00.500932Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"614be421-43ad-4650-beb7-74da05c3800a","year":2023},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.964765Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:d387a7d3fb089678acaa60174e6b5b54ac8f1382c456a5da5b49330431f0482c","observation_id":"aaef66cd-2cf1-4ca4-998e-2f2a53c78ebc","resolution":{"observed_at":"2026-08-06T22:00:00.567283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22332","last_updated":"2025-03-10T00:54:50Z","snapshot_observed_at":"2026-08-04T13:07:16.968985Z","submitted_at":"2024-10-29T17:59:55Z","title":"Local Policies Enable Zero-shot Long-horizon Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22332","snapshot_observed_at":"2026-08-06T21:59:53.047409Z","title":"Local Policies Enable Zero-shot Long-horizon Manipu- lation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.047409Z"},"links":{"cited_paper":"/paper/2410.22332","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:ca69766946abc7618c2606ace506c433ace6502b9e5048d98584e9065596e7a9","observation_id":"98fa6ea6-affb-4ee6-ba8b-7d2214b656fb","resolution":{"observed_at":"2026-08-06T21:59:53.047409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23254","last_updated":"2024-10-30T17:37:31Z","snapshot_observed_at":"2026-08-04T21:03:53.705180Z","submitted_at":"2024-10-30T17:37:31Z","title":"Keypoint Abstraction using Large Models for Object-Relative Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23254","snapshot_observed_at":"2026-08-06T21:59:53.126948Z","title":"Tenenbaum, Tomás Lozano-Pérez, and Leslie Pack Kaelbling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.126948Z"},"links":{"cited_paper":"/paper/2410.23254","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:88a19408e1a5abc9591f6287eb0569afe06329904797e46f1daf9c153574b700","observation_id":"a0742abe-62c4-480e-b1da-c1300c4156ac","resolution":{"observed_at":"2026-08-06T21:59:53.126948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10454","last_updated":"2024-06-15T00:41:34Z","snapshot_observed_at":"2026-08-06T09:53:44.025292Z","submitted_at":"2024-06-15T00:41:34Z","title":"HumanPlus: Humanoid Shadowing and Imitation from Humans","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10454","snapshot_observed_at":"2026-08-06T21:59:53.184656Z","title":"HumanPlus: Humanoid Shadowing and Imitation from Humans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.184656Z"},"links":{"cited_paper":"/paper/2406.10454","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:d5e606f42ad714241cbbf30f68d9ed3758f4ab6dac1078d8783ead2f5ac3f794","observation_id":"82e75abd-4182-4951-81a1-efdbb16c3e01","resolution":{"observed_at":"2026-08-06T21:59:53.184656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02116","last_updated":"2025-04-19T18:59:07Z","snapshot_observed_at":"2026-07-06T20:16:27.318761Z","submitted_at":"2025-01-03T22:00:53Z","title":"Humanoid Locomotion and Manipulation: Current Progress and Challenges in Control, Planning, and Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02116","snapshot_observed_at":"2026-08-06T21:59:53.261446Z","title":"Karen Liu, Abder- rahmane Kheddar, Xue Bin Peng, Yuke Zhu, Guanya Shi, Quan Nguyen, Gordon Cheng, Huijun Gao, and Ye Zhao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.261446Z"},"links":{"cited_paper":"/paper/2501.02116","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:d1f7db0ab4e6a3edcf9bab9e599feb0e24a0f29ad4e35503e31c068efe96cce3","observation_id":"f7e3badf-5afc-4f12-9b3b-3ee07fa22b41","resolution":{"observed_at":"2026-08-06T21:59:53.261446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08858","last_updated":"2024-06-13T06:44:46Z","snapshot_observed_at":"2026-08-06T19:58:25.663767Z","submitted_at":"2024-06-13T06:44:46Z","title":"OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08858","snapshot_observed_at":"2026-08-06T21:59:53.340248Z","title":"OmniH2O: Universal and Dexter- ous Human-to-Humanoid Whole-Body Teleoperation and Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.340248Z"},"links":{"cited_paper":"/paper/2406.08858","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:64872d1cd5d5a13f0afb0274d50fc65ef63128666bba4f007cabef08af294caa","observation_id":"771204e5-90fc-4b4a-bf16-e3a2b21619db","resolution":{"observed_at":"2026-08-06T21:59:53.340248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:00:00.348550Z","title":"Learning human- to-humanoid real-time whole-body teleoperation","venue":null,"work_id":"cf897abe-d6d8-4cc8-a9a7-735e40c7e2c3","year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.398859Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:89b27b52220bd4d070fba92674ab5dc5a2e6e4bb5aa0473ca372b96f00efa8e0","observation_id":"6d72997c-be56-422c-a291-f6a3cab0315e","resolution":{"observed_at":"2026-08-06T22:00:00.421492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01143","last_updated":"2025-04-26T03:22:14Z","snapshot_observed_at":"2026-08-05T20:11:45.203161Z","submitted_at":"2025-02-03T08:22:46Z","title":"ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01143","snapshot_observed_at":"2026-08-06T21:59:53.456439Z","title":"ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.456439Z"},"links":{"cited_paper":"/paper/2502.01143","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:7b8797f400206e01dce7295d5cb1d5e3c3699f67a2ce2ce66276e29bbca5d089","observation_id":"bcf186a8-89af-4632-9e27-f9ee2e9c0129","resolution":{"observed_at":"2026-08-06T21:59:53.456439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:00:00.212662Z","title":"Learning visual quadrupedal loco-manipulation from demonstrations","venue":null,"work_id":"b070cab4-6c13-4ac9-8628-93b5bc40c728","year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.514574Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:4042b3e47980355d8440fedb4fc7725d0f0029a882baf64ae5360564852b4ac6","observation_id":"96a3af25-4ddc-41b0-b7bf-b39ca6820c95","resolution":{"observed_at":"2026-08-06T22:00:00.275793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13196","last_updated":"2025-03-12T00:40:43Z","snapshot_observed_at":"2026-08-07T20:12:33.825003Z","submitted_at":"2024-12-17T18:59:51Z","title":"ExBody2: Advanced Expressive Humanoid Whole-Body Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13196","snapshot_observed_at":"2026-08-06T21:59:53.570181Z","title":"ExBody2: Advanced Expressive Humanoid Whole-Body Control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.570181Z"},"links":{"cited_paper":"/paper/2412.13196","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:7de589152a3568b72b38d7b1ae30d71801f3e5faee088f5e0a2545daa328cc4c","observation_id":"22d8070d-4f94-4a11-9de5-d8990cee27e2","resolution":{"observed_at":"2026-08-06T21:59:53.570181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T21:59:53.626696Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.626696Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:5c473ab4b9b23a842fbadd892e0e9503ba14187627c4bad673032b1bc7ef0c57","observation_id":"af846065-345e-4923-875e-d175eeab42b4","resolution":{"observed_at":"2026-08-06T21:59:53.626696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:00:00.085427Z","title":"Hybrik: A hybrid analytical-neural inverse kinematics solution for 3d human pose and shape estimation","venue":null,"work_id":"6e1434af-96fa-4bdd-953a-6a59ca918867","year":2021},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.685269Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:c147a42fd4edd62d7e09e2c84629f5fd830a1af9844dbb3c001b777b88f3b3b7","observation_id":"155af230-1722-417a-8b8b-ec423ee91e94","resolution":{"observed_at":"2026-08-06T22:00:00.148900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05485","last_updated":"2025-05-10T18:11:38Z","snapshot_observed_at":"2026-07-06T20:33:15.472157Z","submitted_at":"2025-02-08T07:50:22Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05485","snapshot_observed_at":"2026-08-06T21:59:53.761474Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.761474Z"},"links":{"cited_paper":"/paper/2502.05485","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:b95fa74024e02f4ef2c53bc375f9b5f5d6c647c9b2366369ea0418f9b1902638","observation_id":"654c433f-530d-4754-987c-dae4a4dab890","resolution":{"observed_at":"2026-08-06T21:59:53.761474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.839950Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.839950Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:f9668ce056111f0804ed10ea11308287d156fc8b583aed0ec3b5c89c722e8cbf","observation_id":"d1a32033-20af-4716-860d-7473735078a3","resolution":{"observed_at":"2026-08-06T21:59:53.839950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-06T21:59:53.882437Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.882437Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:6cc25570c7de0e87e32d958f7eaa5abdc3d7e5f080847f3c8e0488e47bd9556e","observation_id":"14e1c1cf-8de8-4721-bcd6-c51dd03aa27b","resolution":{"observed_at":"2026-08-06T21:59:53.882437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:59:53.885543Z","title":"Goucher, Adam Perelman, Aditya Ramesh, Aidan Clark, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.885543Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:60421d917a80f01f863858ebc13e3a8bb28b57201d70841a797a7dbab55fafa3","observation_id":"b86bce05-1870-42ab-9e99-1f1b7a87789b","resolution":{"observed_at":"2026-08-06T21:59:53.885543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.890452Z","title":"Quantifying representation reliability in self- supervised learning models","venue":null,"work_id":"e4aa2ebf-0d57-43db-9780-5d8bfe61ae40","year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.888056Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:cca7dcce870bfa7bf4c55446983670e8fb9203b45ae95c8c86c143ed3d2f4729","observation_id":"ef144ca4-ad03-40c1-9249-9331a438cd31","resolution":{"observed_at":"2026-08-06T22:00:00.021442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.689889Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"f435a438-1938-4d1e-9af8-f51bfcc8ec80","year":2021},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.890092Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:f058dda2f386d6edfdb9005489f75100f2adad9b5475fcec4547cc6d968c1e98","observation_id":"08e6259e-ca93-45fd-abcd-d066ccba20bc","resolution":{"observed_at":"2026-08-06T21:59:59.754003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T21:59:53.893050Z","title":"Proximal Policy Optimization Algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.893050Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:6a5e6614f0951c8a5c6c1874298ff4bc7c900dbe1b6de25c0540dc2fe718cc62","observation_id":"3cee411b-bb72-4f69-8381-c25a03499276","resolution":{"observed_at":"2026-08-06T21:59:53.893050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.521713Z","title":"Sketching curvature for efficient out-of-distribution de- tection for deep neural networks","venue":null,"work_id":"af1bb423-c97b-4245-bf40-e051ddebf2a3","year":1958},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:53.921955Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:cde8c0fd2df73ebb1b1d4a693e7d9ed65d561b6579af540b39d51a70f9d41b9d","observation_id":"f85ddf26-eb7a-427d-bf0f-3e0cddc54035","resolution":{"observed_at":"2026-08-06T21:59:59.584238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-06T21:59:54.045154Z","title":"Hi Robot: Open-Ended Instruction Follow- ing with Hierarchical Vision-Language-Action Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.045154Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:6c3dc62967c346d6bb729a97a22dbe75b85b0a8949233d76bb46ca41ae1a6725","observation_id":"b65000dd-4e99-4817-8c13-389d6a582cd6","resolution":{"observed_at":"2026-08-06T21:59:54.045154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-06T21:59:54.272484Z","title":"Gemini robotics: Bringing ai into the physical world","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.272484Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:177c35b9a64707b358747a76457379790cabb333b983f18fbe727fa1d0e93249","observation_id":"4af1bbd7-6916-4807-9ff2-dc4707d96035","resolution":{"observed_at":"2026-08-06T21:59:54.272484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.322816Z","title":"Guiding Long- Horizon Task and Motion Planning with Vision Language Models","venue":null,"work_id":"5d05e10f-0390-45a9-bf5d-4124b479e1ba","year":2025},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.481448Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:4bdfe64e4bba202f277693e9f32a80669f44c4e1e102fcad7b4e003db0a46d65","observation_id":"d5ab2f0e-c7ce-4c27-b85d-e9c413905bda","resolution":{"observed_at":"2026-08-06T21:59:59.446933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-06T21:59:54.651218Z","title":"RoboPoint: A Vision- Language Model for Spatial Affordance Prediction for Robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.651218Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:b5096cbda91da7018b09c12adfe1a043b273a6a2bd96d93c33dd8d1b885ed029","observation_id":"919de7e8-553f-4b0f-a847-4d1c298511a7","resolution":{"observed_at":"2026-08-06T21:59:54.651218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T21:59:54.883464Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:54.883464Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:9924b06bbebfa0190663b92c94fe2e889c9decfc09ed7e4498363200ab655aba","observation_id":"4464a284-559b-402b-991d-d6a4a68f3a8e","resolution":{"observed_at":"2026-08-06T21:59:54.883464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:59.072234Z","title":"Each hidden layer contains 256 units and ReLU activations","venue":null,"work_id":"a6c8a87b-e2bd-4685-b741-2237140ac788","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.019219Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:57d16a38ed81e75a82b7a0015dd37ed51ac9abda598602537b1f1f381d9fccb4","observation_id":"e0ef84e1-fdca-4791-b012-c098fb6b0de1","resolution":{"observed_at":"2026-08-06T21:59:59.190833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:58.790638Z","title":"Example real-time teleoperation is shown in Fig","venue":null,"work_id":"e369ea7e-77b8-4a09-bf7b-7f2d3ae8c10b","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.135712Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:bdb05ed8dfb0e8e0322c45c3c6776b81556a68916c64c95156d5388fe525f993","observation_id":"dc1640ef-0d2e-4f0b-820a-f15281820a93","resolution":{"observed_at":"2026-08-06T21:59:58.953533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:58.451095Z","title":null,"venue":null,"work_id":"a7fe9ed5-2eab-48d6-ae55-565c4db83624","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.249492Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:8c2b07572b6d4eb124f89864a58af1de976b05e96b2062c22e4b7de71bfcf484","observation_id":"cb15ce47-7b67-4c12-9e2f-a726dd32d0cd","resolution":{"observed_at":"2026-08-06T21:59:58.588262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:58.218197Z","title":null,"venue":null,"work_id":"d44f6d2e-ef5d-4f27-bfca-d6961847053d","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.416376Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:85a105960180a05aa29b24be6920cdeb6a6ec80bc5207013ea2f179c2cc0a9f3","observation_id":"3f425a5e-faa2-4428-bcb5-f951bb556e55","resolution":{"observed_at":"2026-08-06T21:59:58.331603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:57.841390Z","title":", πk} based on visual inputs and task prompts","venue":null,"work_id":"dd51c48b-f87b-4c83-b136-49c9c28e3bdb","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.630338Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:e42165a39c1cddcf6fdbdb45aa675cc791eb9502c46c8f823cbf61eac789c299","observation_id":"3cfa29f1-7f4d-4cf3-86ab-01e7025baa78","resolution":{"observed_at":"2026-08-06T21:59:58.060973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:57.509712Z","title":null,"venue":null,"work_id":"36f2c9b1-5bad-45fe-8bde-4553fcb05477","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:55.799218Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:8620962713b2b287f072ec75059fde853aaf1e50e953591aecd1ec8bd69103e7","observation_id":"351fb3b2-1676-4a99-8d22-395d7b7314da","resolution":{"observed_at":"2026-08-06T21:59:57.668140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:57.273756Z","title":"In this example, the monitor verifies whether the object (a) Human operator (b) HybrIK pose detection result Fig","venue":null,"work_id":"60bf97a3-ada3-41fd-b436-1d5a5ec6fcd4","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:56.051191Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:d11027d72c477934e6ce4046d1d9e3ec4fd800d671a050e2a2eef33d9b5e2fc0","observation_id":"c5251146-6d4b-4e3c-8aeb-3c4fdb171b29","resolution":{"observed_at":"2026-08-06T21:59:57.381780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:56.939274Z","title":"Once the monitor confidently determines the com- pletion of this skill, it signals the transition to the next planned skill","venue":null,"work_id":"1452e3ef-1d25-4b5f-b743-ed133004f7d1","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:56.172913Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:3fd0f8725173b9766f5017f9c8767c944ef9233d3109f38df0e54c417346b5a3","observation_id":"9c910987-98bf-4326-a7f3-028e31efbba5","resolution":{"observed_at":"2026-08-06T21:59:57.126378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:56.658315Z","title":"skill_name","venue":null,"work_id":"215bc104-8f69-4bd8-84fe-5015ae946416","year":null},"citing_paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:56.340266Z"},"links":{"citing_paper":"/paper/2506.22827"},"observation_digest":"sha256:9a43610d9524b1e1d3431dd5dbb3f9e6f4df5b1864e120a69c23b36d09cc9bcf","observation_id":"981385a1-158a-47a2-8b43-36019b340246","resolution":{"observed_at":"2026-08-06T21:59:56.764701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22827","last_updated":"2025-07-10T08:49:49Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T21:54:54.483488Z","submitted_at":"2025-06-28T09:39:37Z","title":"Hierarchical Vision-Language Planning for Multi-Step Humanoid Manipulation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 3 inbound Pith citation observations for arXiv:2506.22827."}