{"as_of":"2026-08-07T02:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b3ada242eb620494bb9d36ffbf6ef89fab58f27973bc19d2ed712288001867e","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T04:32:58.733165Z","state":"measured"},{"denominator":155,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":155,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":72,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:20:20.579410Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T15:20:20.579410Z","title":"Egovla: Learning vision-language-action models from egocentric human videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20085","last_updated":"2025-08-31T06:47:56Z","snapshot_observed_at":"2026-08-06T13:04:42.910229Z","submitted_at":"2025-08-27T17:53:46Z","title":"HERMES: Human-to-Robot Embodied Learning from Multi-Source Motion Data for Mobile Dexterous Manipulation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:20:20.579410Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2508.20085"},"observation_digest":"sha256:4130cb441a25fc9364b6b8372c0f0956e8366bf1ed6bd3041bda5d31b0ec4893","observation_id":"c8eb7e53-f544-443a-bdd0-da4c063eaf84","resolution":{"observed_at":"2026-08-05T15:20:20.579410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-04T18:50:16.771640Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09671","last_updated":"2025-09-11T17:59:07Z","snapshot_observed_at":"2026-08-05T20:58:48.791818Z","submitted_at":"2025-09-11T17:59:07Z","title":"Dexplore: Scalable Neural Control for Dexterous Manipulation from Reference-Scoped Exploration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T18:50:16.771640Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2509.09671"},"observation_digest":"sha256:fb7db22efefc74d7632b6dc7bf0c435dee712a0eeb0708f20f034552038f6b19","observation_id":"78290916-5698-45fb-8855-3e5e8279fec2","resolution":{"observed_at":"2026-08-04T18:50:16.771640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-04T00:28:28.407653Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.01177","last_updated":"2026-07-21T02:42:52Z","snapshot_observed_at":"2026-08-06T14:43:24.215969Z","submitted_at":"2025-11-03T03:02:16Z","title":"Scaling Cross-Embodiment World Models for Dexterous Manipulation","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T00:28:28.407653Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2511.01177"},"observation_digest":"sha256:6137f1cc54ff545e523a3f2410ce6b318715858750cfc794674185fdd3d87943","observation_id":"f85aafc8-57c6-4c01-9bd7-9893a48d9ece","resolution":{"observed_at":"2026-08-04T00:28:28.407653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-05-16T17:02:33.997887Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2602.06949"},"observation_digest":"sha256:5ce4e3650f04ab9794df3edf56ab2b7119d45069025e96f15d5885f66661fb51","observation_id":"ad14006c-7330-461a-b4c3-6483b931bc30","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-03T01:19:59.046127Z","title":"EgoVLA: Learning vision- language-action models from egocentric human videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10106","last_updated":"2026-06-04T12:33:57Z","snapshot_observed_at":"2026-08-03T01:19:50.892697Z","submitted_at":"2026-02-10T18:59:03Z","title":"EgoHumanoid: Unlocking In-the-Wild Loco-Manipulation with Robot-Free Egocentric Demonstration","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T01:19:59.046127Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2602.10106"},"observation_digest":"sha256:0e0f254b43d6f050becb87270c1388342c1a91fcb17d6f83636257ca6fdc3251","observation_id":"e6e77eb6-0f66-40f4-8c65-6b9edf9ecf2a","resolution":{"observed_at":"2026-08-03T01:19:59.046127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-02T23:57:44.698790Z","title":"Egovla: Learning vision- language-action models from egocentric human videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12215","last_updated":"2026-06-03T04:04:20Z","snapshot_observed_at":"2026-08-02T23:57:43.860710Z","submitted_at":"2026-02-12T17:53:51Z","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T23:57:44.698790Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2602.12215"},"observation_digest":"sha256:52efdb882c0b98418987701cf4f8dd5713d14572dc5cf82124fc8b4c5c0420bd","observation_id":"d3442e1a-da2f-43de-8da1-61d77661401e","resolution":{"observed_at":"2026-08-02T23:57:44.698790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-02T21:12:28.816574Z","title":"Egovla: Learning vision-language-action models from egocentric hu- man videos.arXiv preprint arXiv:2507.12440, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21172","last_updated":"2026-06-05T21:24:23Z","snapshot_observed_at":"2026-08-03T02:26:02.645885Z","submitted_at":"2026-02-24T18:17:21Z","title":"NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T21:12:28.816574Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2602.21172"},"observation_digest":"sha256:15eeece12bc56ab796539041b1538699c07b0d597b43c41fd95584667beb003a","observation_id":"932f7c20-2c5a-4502-a56b-5c850330bb7d","resolution":{"observed_at":"2026-08-02T21:12:28.816574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2603.03243","last_updated":"2026-05-14T23:12:06Z","snapshot_observed_at":"2026-08-01T20:30:21.157166Z","submitted_at":"2026-03-03T18:36:49Z","title":"HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T11:30:47.668896Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2603.03243"},"observation_digest":"sha256:c68299e84ba07c97777ac74e1a05475c41e9e98346f9404c34b05e07e44a6b2b","observation_id":"26322bfc-c4db-4a3b-833b-27c7c5b48b45","resolution":{"observed_at":"2026-05-21T11:34:09.117855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-07-13T18:05:58.357155Z","title":"arXiv preprint arXiv:2507.12440 (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.25726","last_updated":"2026-06-05T20:32:54Z","snapshot_observed_at":"2026-08-06T06:19:16.284547Z","submitted_at":"2026-03-26T17:58:54Z","title":"AnyHand: A Large-Scale Synthetic Dataset for RGB(-D) Hand Pose Estimation","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-13T18:05:58.357155Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2603.25726"},"observation_digest":"sha256:9e2fbce163c6867e189ed1aa34665128b730eaec8c6f3fda75b334c79327690e","observation_id":"f1c6ebd1-fa47-467f-b286-b9573dd6dcfa","resolution":{"observed_at":"2026-07-13T18:05:58.357155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.07517","last_updated":"2026-04-08T18:52:16Z","snapshot_observed_at":"2026-07-06T22:55:46.307881Z","submitted_at":"2026-04-08T18:52:16Z","title":"Grasp as You Dream: Imitating Functional Grasping from Generated Human Demonstrations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:30.169431Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.07517"},"observation_digest":"sha256:96d5014dc10e3a5eaf38c02dac3b2f974c9aca71e5d0ef5d0b468d1fe9088ffc","observation_id":"aff72e32-ae8a-4f7c-b80e-ed568a4dca57","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-07-13T08:25:19.322550Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T17:07:41.489995Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:16405fb6d566f04694cde5cf7e2d4058039d7783bc8f34800be80e187ab174b7","observation_id":"65dbfa02-8a97-4b70-bb3e-fe86bc17275d","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-07-13T08:25:22.011013Z","title":"Egovla: Learning vision-language-action models from egocentric human videos, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-07-13T08:25:19.322550Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T08:25:22.011013Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:e6c8f88bb88a5ef9fda8611c741444bafd575966ff1fd507b84cc73c2aacf878","observation_id":"565988b3-96fb-4146-9501-9d899833eeea","resolution":{"observed_at":"2026-07-13T08:25:22.011013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.07993","last_updated":"2026-05-19T11:30:49Z","snapshot_observed_at":"2026-08-02T02:27:22.352995Z","submitted_at":"2026-04-09T09:01:43Z","title":"HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T17:44:32.243968Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.07993"},"observation_digest":"sha256:8cbb9493c2481cd1888ba602e3986aff17b2d865cfba7ee38ee4d05c3935c1a1","observation_id":"c74a357c-428d-45f6-8605-4ff72320bcfb","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.07993","last_updated":"2026-05-19T11:30:49Z","snapshot_observed_at":"2026-08-02T02:27:22.352995Z","submitted_at":"2026-04-09T09:01:43Z","title":"HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T09:49:34.983940Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.07993"},"observation_digest":"sha256:bf21298312f6d3abb5e3f6853ebbcf537bd18e33d238b5d93531315e33857c11","observation_id":"0f6b5d9a-0edc-478b-8ebd-8942f31965e1","resolution":{"observed_at":"2026-05-21T09:49:57.294769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.08534","last_updated":"2026-04-09T17:59:08Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:59:08Z","title":"ActiveGlasses: Learning Manipulation with Active Vision from Ego-centric Human Demonstration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T17:24:54.053447Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.08534"},"observation_digest":"sha256:62f33ead5266d0477b1cf56d64ae767178026c819146751333937f8e8cfb44c4","observation_id":"1e6a4e8d-c484-4181-a36a-80d8c798b6a9","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.10677","last_updated":"2026-04-12T15:02:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T15:02:34Z","title":"LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:36:23.197843Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.10677"},"observation_digest":"sha256:262f901d8c6ac1350ee093bea4bc2fe16dadf5d50acd5e14aaade923ff65db90","observation_id":"2f849ef2-1c7a-4974-be45-c6cf61e388d2","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T11:42:34.409651Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.15483"},"observation_digest":"sha256:f4fe692f1c81834bf3d5364bc4e97f268c612bdf833170c6fd1bc721422d5c6d","observation_id":"5b3a441a-bf1a-4da0-905a-6e077ac80f7e","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:abc02b64bda6b1dedd6aeb3703ea1bdbf0ee3574b84f06a805db172f2e2b494c","observation_id":"ab2236a3-384b-4c1e-a969-5621dad563a7","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T22:07:24.208555Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:929fabf30cb14976327d226791047996295f71356364376e36ca092d21cf186a","observation_id":"89107eb2-2940-4a2e-b0a6-e3085a931b34","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-07-12T18:39:49.173828Z","title":"Egovla: Learning vision–language–action models from egocentric human videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.21241","last_updated":"2026-07-05T14:51:02Z","snapshot_observed_at":"2026-07-12T18:39:48.745028Z","submitted_at":"2026-04-23T03:17:50Z","title":"CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T18:39:49.173828Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.21241"},"observation_digest":"sha256:0b80704ccf7ea8fe80e9aeaac3f6663e54e95c809b4982acae41efa9116d45ca","observation_id":"a9991ad8-1c8d-4bfb-9443-9dfe0f7e1350","resolution":{"observed_at":"2026-07-12T18:39:49.173828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.22615","last_updated":"2026-04-30T12:27:46Z","snapshot_observed_at":"2026-08-06T16:33:11.467195Z","submitted_at":"2026-04-24T14:46:03Z","title":"GazeVLA: Learning Human Intention for Robotic Manipulation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-08T11:37:30.784513Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.22615"},"observation_digest":"sha256:4053c454d493a7f7098de2b2a967bc8c5d167cbee480c110335b287e3be15d07","observation_id":"56074592-06cd-44b0-be07-313183bcd6e6","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.23570","last_updated":"2026-04-26T07:21:15Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T07:21:15Z","title":"EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T06:19:34.743194Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.23570"},"observation_digest":"sha256:06f97800f58ffda3cfc18b556bb5d6ec23d296f838b7ad33585d9662be75d796","observation_id":"97742f1d-b1dc-4bc0-a5b0-282eab0d5f3c","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T02:51:27.662262Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:ea80bb8e1e7c51d8939e85efa390380863ff9bd7b3d0f71369027bbdd5debaec","observation_id":"33c0d231-2c86-4a9f-be89-b633977734a6","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2604.24681","last_updated":"2026-05-21T05:08:13Z","snapshot_observed_at":"2026-08-02T19:33:59.938088Z","submitted_at":"2026-04-27T16:42:18Z","title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T11:16:58.104663Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2604.24681"},"observation_digest":"sha256:7823770f460f56d1d0b17a6408b0a28adc7cdf622689fd2393a76dbc006806c1","observation_id":"142db0f4-95a6-4790-bbda-d1ab0ad3fb2c","resolution":{"observed_at":"2026-05-22T11:21:29.219837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-09T20:48:01.461993Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.00078"},"observation_digest":"sha256:899c70bb727334b3f745ff42c0634ae8a56e86c762129930eabfbf1509f42174","observation_id":"cd341fd6-ad13-4b0b-aa5d-476c670cb09c","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.12038","last_updated":"2026-05-12T12:21:11Z","snapshot_observed_at":"2026-08-03T04:49:14.402546Z","submitted_at":"2026-05-12T12:21:11Z","title":"OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T06:54:49.169238Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.12038"},"observation_digest":"sha256:b6abe3a6175c5308d60dc1e0db9cfe211167336b60aa739d612344055cf26b89","observation_id":"40e74a6d-e5a1-44f1-940d-46776c42825a","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":204,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:6917cd0a9078d09895c029f0df25c2d990d42c13ac0e7ef5be20c6defb91a538","observation_id":"c48085dd-ca5d-4c85-b219-fdb75ce68d75","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.16412","last_updated":"2026-05-13T16:23:11Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-13T16:23:11Z","title":"SCAR: Self-Supervised Continuous Action Representation Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T20:38:44.286516Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.16412"},"observation_digest":"sha256:5f1677660ae939cc0bfb4aefc6d2d58ce4d4430b4f962e9780c783dea57e3925","observation_id":"8d727f0a-fc92-4900-b9dd-1d7d4b590b40","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.16797","last_updated":"2026-05-16T03:59:17Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:59:17Z","title":"EgoKit: Towards Unified Low-Cost Egocentric Data Collection with Heterogeneous Devices","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T21:20:56.830588Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.16797"},"observation_digest":"sha256:1b37727ad0bb1e75675e11da43a90722072d6c0749a2c952db326b47044bf265","observation_id":"fa2b2816-8762-4c3c-9096-c4e43be05bc6","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.18553","last_updated":"2026-05-18T15:33:15Z","snapshot_observed_at":"2026-07-31T10:37:05.848827Z","submitted_at":"2026-05-18T15:33:15Z","title":"StableHand: Quality-Aware Flow Matching for World-Space Dual-Hand Motion Estimation from Egocentric Video","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T11:11:21.610700Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.18553"},"observation_digest":"sha256:a91e9072caa13410d5f0a479766f4368f29d2a837c597ccddc3e74b543168062","observation_id":"0f7901b9-33cd-4cae-b2a0-1a5fa9e5c865","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.18722","last_updated":"2026-05-18T17:50:32Z","snapshot_observed_at":"2026-08-01T15:09:43.215699Z","submitted_at":"2026-05-18T17:50:32Z","title":"Dexora: Open-source VLA for High-DoF Bimanual Dexterity","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T09:43:53.032153Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.18722"},"observation_digest":"sha256:2bd841be89972de718653a8ecf77575b43276e1799457b599db766af2c728528","observation_id":"fabb0792-6596-47fa-b9dc-4b6e2b2624f8","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.21133","last_updated":"2026-07-07T18:35:52Z","snapshot_observed_at":"2026-08-03T00:41:31.531422Z","submitted_at":"2026-05-20T13:05:31Z","title":"Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T04:16:15.510851Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.21133"},"observation_digest":"sha256:8a75cbe19794c062e05a11b40b3e803299972407e9dbfdb677b6dbd3cb858017","observation_id":"bb346e45-957f-43f9-ac86-1dfd7103aeb5","resolution":{"observed_at":"2026-05-21T04:32:58.962571Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.24934","last_updated":"2026-05-28T10:10:45Z","snapshot_observed_at":"2026-07-06T23:34:57.148983Z","submitted_at":"2026-05-24T08:26:41Z","title":"HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T01:02:58.035784Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.24934"},"observation_digest":"sha256:69f0a074a81d568ff615baf009dc2ef7646ba2a0e6651bb73e23cf300c4ef647","observation_id":"f10432fc-2773-45f3-943a-838afbd94419","resolution":{"observed_at":"2026-07-01T15:45:48.692760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2605.30307","last_updated":"2026-05-28T17:51:38Z","snapshot_observed_at":"2026-08-02T22:39:52.853482Z","submitted_at":"2026-05-28T17:51:38Z","title":"Grounded 3D-Aware Spatial Vision-Language Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T08:08:36.012761Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2605.30307"},"observation_digest":"sha256:7b4d68f6dfdfaaed79fba8965bde6cc3186aa05d059644dbced6e37e57472e04","observation_id":"e6b7e8f7-4376-472e-abb6-ceb3f62b59b9","resolution":{"observed_at":"2026-06-29T08:13:15.386870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.00054","last_updated":"2026-05-18T06:19:16Z","snapshot_observed_at":"2026-08-01T07:41:38.093783Z","submitted_at":"2026-05-18T06:19:16Z","title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T18:53:07.734871Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.00054"},"observation_digest":"sha256:73f74a0b6dc0db66c0ebf124c3736c25f421a9402bf59b7af1e1452e28b4b82c","observation_id":"b95a5978-599b-4eb8-a88c-ceba7b7e504b","resolution":{"observed_at":"2026-06-30T18:55:00.228649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.06194","last_updated":"2026-06-04T14:01:01Z","snapshot_observed_at":"2026-08-04T07:55:49.422544Z","submitted_at":"2026-06-04T14:01:01Z","title":"ActiveMimic: Egocentric Video Pretraining with Active Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T01:19:47.785250Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.06194"},"observation_digest":"sha256:e2a3f8c3b9a90166b4bf9f228a00233e36ef784c0e8b20fd2679abdced86ffb2","observation_id":"f79ce0d9-38b5-4985-ac81-51426ad7fb61","resolution":{"observed_at":"2026-07-02T13:26:58.952670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.06627","last_updated":"2026-06-04T18:24:23Z","snapshot_observed_at":"2026-08-02T21:21:58.611249Z","submitted_at":"2026-06-04T18:24:23Z","title":"What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T01:04:26.608953Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.06627"},"observation_digest":"sha256:6a3edf10656a2b26c2f5ff1b869208cd1ce3aeb53eb25b248fa4c498669583da","observation_id":"a8d1bbf8-b4ed-49f9-8a3d-2034fd8e6545","resolution":{"observed_at":"2026-07-02T13:46:58.976851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.08278","last_updated":"2026-06-06T17:55:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-06T17:55:43Z","title":"SIMPLE: Simulation-Based Policy Learning and Evaluation for Humanoid Loco-manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T19:29:15.489648Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.08278"},"observation_digest":"sha256:c8e9a3f2fdef535f87d6a0f78497a7c460424dde02c8dc2d87b9355c57c0b7ae","observation_id":"eb25e211-2b4f-40c8-9972-461e2ad3a8ee","resolution":{"observed_at":"2026-07-02T21:47:28.059830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.08495","last_updated":"2026-06-07T07:49:19Z","snapshot_observed_at":"2026-07-06T23:47:57.376596Z","submitted_at":"2026-06-07T07:49:19Z","title":"EgoPriMo: Egocentric Motion Generation for Interactive Humanoid Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T18:37:52.734998Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.08495"},"observation_digest":"sha256:99c2421d0f607e1d9ba246bf11536c780e42cfa991215d8762dac8fe96f82c7a","observation_id":"d3656c35-33f6-4663-8b7d-c25e52ed22ef","resolution":{"observed_at":"2026-07-02T22:47:26.330508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.09215","last_updated":"2026-06-08T08:50:14Z","snapshot_observed_at":"2026-08-05T23:08:42.148456Z","submitted_at":"2026-06-08T08:50:14Z","title":"MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:25.136391Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.09215"},"observation_digest":"sha256:afaa71ad784d7bc691021376e472249ef37e358f57dd51c5ac3679dadb314959","observation_id":"1a6ae559-f93f-4a7e-a9fe-577820a3819d","resolution":{"observed_at":"2026-07-03T01:37:30.719272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.11628","last_updated":"2026-06-10T03:49:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T03:49:01Z","title":"LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T10:02:54.183839Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.11628"},"observation_digest":"sha256:c9676a4fd567d4cae3470b0959337bbe801c0d3f19606042781b5dfca8392f15","observation_id":"ccc259b1-1094-49f7-9d6e-f222ebc55d83","resolution":{"observed_at":"2026-07-03T10:27:56.197162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.12497","last_updated":"2026-06-10T13:26:40Z","snapshot_observed_at":"2026-08-05T05:15:21.338433Z","submitted_at":"2026-06-10T13:26:40Z","title":"$\\mu$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T10:50:55.866910Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.12497"},"observation_digest":"sha256:e1d9a7b4a105a8d182d8a6fc52ca3d6dd9573dbb5a0bd39599bf19707d27a503","observation_id":"df504181-4c65-40e4-9a47-4e05af4bb914","resolution":{"observed_at":"2026-07-03T08:17:45.707779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.12604","last_updated":"2026-06-10T19:01:40Z","snapshot_observed_at":"2026-08-05T03:29:41.720044Z","submitted_at":"2026-06-10T19:01:40Z","title":"EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T09:27:43.453005Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.12604"},"observation_digest":"sha256:d57932fde89557b2fbb7c1b87b2b47b0dfc49addb976df8bc866ed439a9c632d","observation_id":"f1340118-19e1-4b7d-8edd-c71c044bbf4c","resolution":{"observed_at":"2026-07-03T11:38:05.121651Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.12965","last_updated":"2026-06-11T06:49:39Z","snapshot_observed_at":"2026-07-06T23:51:49.819867Z","submitted_at":"2026-06-11T06:49:39Z","title":"EmbodiSteer: Steering Embodiment-Agnostic Visuomotor Policies with Joint-Space Guidance for Zero-Shot Cross-Embodiment Deployment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T06:36:40.317160Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.12965"},"observation_digest":"sha256:9673a9e055b5efd78b86abe0279a74c14c72baf28f03e0fa28caf7ea4a3ad347","observation_id":"7922ea34-3b38-457b-8fbb-cdafda1e772f","resolution":{"observed_at":"2026-07-03T15:18:33.076842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.13102","last_updated":"2026-06-19T08:31:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T09:30:09Z","title":"FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T07:02:17.427032Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.13102"},"observation_digest":"sha256:a78dc99c1d1c56ccc400470a9cbf0ad40b8011f19962d4334edc6cccce171859","observation_id":"3f93b938-4c8d-4bdf-860d-f854ff00101c","resolution":{"observed_at":"2026-07-03T14:28:31.721392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-02T11:31:33.814742Z","title":"Egovla: Learning vision-language-action models from egocentric human videos.arXiv preprint arXiv:2507.12440, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-05T17:41:55.223171Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.814742Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:cc0bb9891425d10fe915250d38e99bb383448942ed2abd3a129d67926a89ed68","observation_id":"b0a28147-1a24-4c47-aa17-1de436a5d9a1","resolution":{"observed_at":"2026-08-02T11:31:33.814742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.17055","last_updated":"2026-06-18T20:58:46Z","snapshot_observed_at":"2026-07-06T23:52:42.390632Z","submitted_at":"2026-06-15T17:59:55Z","title":"T-Rex: Tactile-Reactive Dexterous Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T03:48:22.394092Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.17055"},"observation_digest":"sha256:247bc9c4e619e0441725c0c0be036e82717282de82e64d9e6019e33e960581a4","observation_id":"a21ea5b0-d478-4cd8-bc39-fef362b3d092","resolution":{"observed_at":"2026-07-03T17:48:45.836541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.17200","last_updated":"2026-06-15T18:40:18Z","snapshot_observed_at":"2026-08-04T22:44:21.289174Z","submitted_at":"2026-06-15T18:40:18Z","title":"ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T03:25:39.450667Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.17200"},"observation_digest":"sha256:c0792bdbe4d5c4f5dfdbf465dd55366e1db324776eae3a7e3dbf5420db900c8f","observation_id":"c8fa37e1-ecbb-49f1-ad94-e889a471146d","resolution":{"observed_at":"2026-07-03T17:58:47.605592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.17200","last_updated":"2026-06-15T18:40:18Z","snapshot_observed_at":"2026-08-04T22:44:21.289174Z","submitted_at":"2026-06-15T18:40:18Z","title":"ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T03:25:39.450667Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.17200"},"observation_digest":"sha256:4cb5d37fd041b0faaa7c37529ee73f0efa1087933ff2e5cf67a4438d51c8bf48","observation_id":"b2c97fd8-6c75-4771-9235-58d325786214","resolution":{"observed_at":"2026-06-27T03:30:26.569142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.18558","last_updated":"2026-06-17T00:19:00Z","snapshot_observed_at":"2026-07-06T23:53:59.519305Z","submitted_at":"2026-06-17T00:19:00Z","title":"MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-26T21:27:47.702578Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.18558"},"observation_digest":"sha256:43ed7a728dc59de966e6640a5cd6fddab3b3e2b89ccd5f4ac56ea5d5f49ce0c1","observation_id":"3f728eff-8671-4dce-b4ad-0d0782c52100","resolution":{"observed_at":"2026-07-04T00:09:14.740739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.19333","last_updated":"2026-06-17T17:57:34Z","snapshot_observed_at":"2026-08-02T12:23:55.177494Z","submitted_at":"2026-06-17T17:57:34Z","title":"Do as I Do: Dexterous Manipulation Data from Everyday Human Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T20:51:21.209882Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.19333"},"observation_digest":"sha256:8a1dcde94a8d40fdbfb2bdf4440c13b6b93c27162413d17871893c2ea85f8117","observation_id":"fcb465fd-1fb9-4042-a1a4-aaf2326d7ce3","resolution":{"observed_at":"2026-07-04T00:59:19.370892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.21406","last_updated":"2026-06-19T13:17:27Z","snapshot_observed_at":"2026-08-03T16:52:45.806990Z","submitted_at":"2026-06-19T13:17:27Z","title":"Robot Self-Improvement via Human-Video Dynamics Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T14:40:13.855741Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.21406"},"observation_digest":"sha256:e5a2aaa11dfd0f7a2c0d2d97a5ca815175a4d99d35f02b3644250d95446bf545","observation_id":"3c0ed274-eed9-4717-a7ff-a1651544ec89","resolution":{"observed_at":"2026-07-04T06:19:37.582669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.22136","last_updated":"2026-06-23T09:28:18Z","snapshot_observed_at":"2026-08-06T21:01:23.847051Z","submitted_at":"2026-06-20T16:31:40Z","title":"Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T11:47:54.951618Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.22136"},"observation_digest":"sha256:e07c4a209c58b53b29d9e0ce7c5ffeb6aa72f215f108f1893f512a2bd5d8a3cb","observation_id":"0e10fb32-2be9-4c54-a351-15c785ad5163","resolution":{"observed_at":"2026-07-04T08:19:44.691062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.22174","last_updated":"2026-06-20T18:02:50Z","snapshot_observed_at":"2026-08-05T16:28:37.360723Z","submitted_at":"2026-06-20T18:02:50Z","title":"OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T11:38:43.339469Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.22174"},"observation_digest":"sha256:9b49add6132b542e7f4e7d5fd45f2182c053484a666f4b9bc0c122d1f0fb32a3","observation_id":"3f022312-5323-40e6-839e-a5bdd55acc8f","resolution":{"observed_at":"2026-07-04T08:29:41.808247Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.23685","last_updated":"2026-06-22T17:59:52Z","snapshot_observed_at":"2026-08-02T17:54:27.887583Z","submitted_at":"2026-06-22T17:59:52Z","title":"LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T07:58:17.225491Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.23685"},"observation_digest":"sha256:9352125d4cb9efa10ff282d70af6dd62eed53c7374f230bd34f69ff199a6c9d2","observation_id":"a93b0869-f00c-4480-988d-94f1e06b26b1","resolution":{"observed_at":"2026-07-04T11:29:50.824933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.24539","last_updated":"2026-06-23T13:06:51Z","snapshot_observed_at":"2026-08-02T12:19:25.025255Z","submitted_at":"2026-06-23T13:06:51Z","title":"PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-06-26T00:46:17.094339Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.24539"},"observation_digest":"sha256:3ff2658e307bd31a8a2a04cecefab7d37b89c37b6223e428638822f60e60238b","observation_id":"363bcb00-4a44-42cd-923b-dd79a16e2d23","resolution":{"observed_at":"2026-07-04T16:19:57.788956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.25160","last_updated":"2026-06-23T20:46:54Z","snapshot_observed_at":"2026-07-06T23:59:37.533078Z","submitted_at":"2026-06-23T20:46:54Z","title":"Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T23:47:12.032082Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.25160"},"observation_digest":"sha256:fe918c41880a0b5b882b7fc40ca26b6369c1b951819a3037de95badf434fb96c","observation_id":"7431e20f-57f7-4d3e-accf-5bc403869779","resolution":{"observed_at":"2026-07-04T17:20:00.473782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.26428","last_updated":"2026-07-09T17:59:45Z","snapshot_observed_at":"2026-08-02T14:53:42.434742Z","submitted_at":"2026-06-24T22:39:12Z","title":"Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-26T01:13:08.086026Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.26428"},"observation_digest":"sha256:2b4f65594dc72afd64d6d81714c999a926ae6b24d8b68f96d6978f626175f0df","observation_id":"b3f5f51c-379b-4bcb-82aa-967b6acabd28","resolution":{"observed_at":"2026-07-04T15:59:56.320457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-07-12T12:00:50.387540Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26428","last_updated":"2026-07-09T17:59:45Z","snapshot_observed_at":"2026-08-02T14:53:42.434742Z","submitted_at":"2026-06-24T22:39:12Z","title":"Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T12:00:50.387540Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.26428"},"observation_digest":"sha256:85f1e31e74e356764ce9157c5d6dcc4097205ca1b8954d09c1ca90015e4f20df","observation_id":"d83d8a1e-aa7f-475f-804c-21e5f767c959","resolution":{"observed_at":"2026-07-12T12:00:50.387540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.28133","last_updated":"2026-06-26T14:34:04Z","snapshot_observed_at":"2026-08-05T12:02:21.397136Z","submitted_at":"2026-06-26T14:34:04Z","title":"Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T04:23:04.622902Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.28133"},"observation_digest":"sha256:252fb2675bbbfca13a4276e46652fc50e9fe65f143112b75cd4acdd176896e30","observation_id":"69eeb5ac-c36e-4839-b093-e724b23c8af2","resolution":{"observed_at":"2026-07-01T16:55:51.451925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2606.32009","last_updated":"2026-06-30T17:44:16Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:44:16Z","title":"Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T05:02:17.092213Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.32009"},"observation_digest":"sha256:d6a0c19229079cf7f42ceb9e62b82d5cc19ff61dc98e50eb1dd723a14a7d3607","observation_id":"5fde026c-793c-4a22-9fe3-73798e4de340","resolution":{"observed_at":"2026-07-01T10:55:41.355626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2607.00547","last_updated":"2026-07-01T07:39:14Z","snapshot_observed_at":"2026-08-02T11:00:21.765614Z","submitted_at":"2026-07-01T07:39:14Z","title":"EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-02T15:04:09.575186Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.00547"},"observation_digest":"sha256:8f447a7ce4261ab0eadb11f5524030e17f63f9cd93711477d792be492752913f","observation_id":"12b12969-e47f-4eba-906d-ee8abef1d384","resolution":{"observed_at":"2026-07-02T15:07:03.962903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2607.01067","last_updated":"2026-07-01T15:26:26Z","snapshot_observed_at":"2026-08-03T00:56:59.776196Z","submitted_at":"2026-07-01T15:26:26Z","title":"Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-02T11:18:32.259684Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.01067"},"observation_digest":"sha256:7b812b97bdc096971222da5a03e0c4a52d92ea5d6bdaa2f5a4e68d8682c6935d","observation_id":"5214ee80-de4c-4955-bb8e-b7b497330267","resolution":{"observed_at":"2026-07-02T11:26:53.965852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-07-11T22:51:22.538166Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03941","last_updated":"2026-07-04T16:26:39Z","snapshot_observed_at":"2026-08-06T17:14:27.550334Z","submitted_at":"2026-07-04T16:26:39Z","title":"WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T22:51:22.538166Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.03941"},"observation_digest":"sha256:d8566979cee58a44cb7eef183a9bdbc476e14e26995a008ba6f2a65ce8d6c2ac","observation_id":"18ce32f8-ccd3-4bbb-83fe-7fbd7bb17eda","resolution":{"observed_at":"2026-07-11T22:51:22.538166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":"2507.12440","doi":"10.48550/arxiv.2507.12440","metadata_source":"pith","pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","venue":"cs.RO","work_id":"14ae45e8-e465-4230-99bf-0a2a191dabfd","year":2025},"citing_paper":{"arxiv_id":"2607.08436","last_updated":"2026-07-08T16:11:37Z","snapshot_observed_at":"2026-08-02T08:56:31.321169Z","submitted_at":"2026-07-08T16:11:37Z","title":"EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T18:39:34.356696Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.08436"},"observation_digest":"sha256:46349ca031ffe5140b09587b52fbc5bf547edc00200376eac9c3bcf35738abbe","observation_id":"5a02135a-b814-4c23-a705-10d9051c8fde","resolution":{"observed_at":"2026-07-10T18:47:31.663947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-07-14T17:30:54.988498Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09701","last_updated":"2026-06-21T16:16:02Z","snapshot_observed_at":"2026-08-01T23:36:03.315592Z","submitted_at":"2026-06-21T16:16:02Z","title":"EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T17:30:54.988498Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.09701"},"observation_digest":"sha256:8cf5916a3f4236ff3d25c00fa89b4c86388e258ab1344884ed7ab51741bf55d3","observation_id":"f1521096-62c9-424b-8ad1-8040816255d5","resolution":{"observed_at":"2026-07-14T17:30:54.988498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-02T03:25:28.118760Z","title":"EgoVLA: Learning vision-language-action models from egocentric human videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14183","last_updated":"2026-07-18T10:02:02Z","snapshot_observed_at":"2026-08-07T01:27:34.322710Z","submitted_at":"2026-07-15T14:49:49Z","title":"Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:25:28.118760Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.14183"},"observation_digest":"sha256:8dbfa20ddfe64590d0131578624db73ecfa24b37dc0b403c04c7a15382093e94","observation_id":"a58bd9c8-4c2a-4b09-9131-e0a0307058df","resolution":{"observed_at":"2026-08-02T03:25:28.118760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-02T02:42:49.111022Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14252","last_updated":"2026-07-15T18:12:28Z","snapshot_observed_at":"2026-08-06T08:47:04.361830Z","submitted_at":"2026-07-15T18:12:28Z","title":"MEMORA: Embodied Action Memory from Egocentric Videos for Reasoning and Planning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T02:42:49.111022Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.14252"},"observation_digest":"sha256:036deb4b5f3a7feceb7ef60539ea6993e4012a0f46bb350edb91952bdfd963ba","observation_id":"c4c67866-0373-46da-8f5a-9db043203143","resolution":{"observed_at":"2026-08-02T02:42:49.111022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-01T22:04:55.957529Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15890","last_updated":"2026-08-05T10:06:27Z","snapshot_observed_at":"2026-08-07T01:26:39.357963Z","submitted_at":"2026-07-17T12:05:07Z","title":"Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T22:04:55.957529Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.15890"},"observation_digest":"sha256:87c3a8b2e1c7939db63326f375a7a7bc209f9d074e28d42d1ea19f6462980f28","observation_id":"45e4ddb7-eb0d-4b11-adcf-24fcbb078b2f","resolution":{"observed_at":"2026-08-01T22:04:55.957529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-01T11:54:20.233779Z","title":"EgoVLA: Learning vision-language-action models from egocentric human videos.arXivpreprint arXiv:2507.12440, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19745","last_updated":"2026-07-23T16:20:02Z","snapshot_observed_at":"2026-08-06T04:18:46.658627Z","submitted_at":"2026-07-22T04:44:26Z","title":"EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:20.233779Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.19745"},"observation_digest":"sha256:017d0532585f99674d123d6820d6c7b561e312c3a938f814549e259b43f49212","observation_id":"19195c38-fbae-483b-915e-b10e7145e626","resolution":{"observed_at":"2026-08-01T11:54:20.233779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-07-31T08:51:08.859285Z","title":"Egovla: Learning vision-language-action models from egocentric hu- man videos.arXiv preprint arXiv:2507.12440, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T23:11:29.841318Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T08:51:08.859285Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:d3c2f49bae54edc3f326d4ecd5b70e6695d4bcf7324f677776d0eb7aa6b784d3","observation_id":"48498a43-221c-4383-9281-9d9f02c6db98","resolution":{"observed_at":"2026-07-31T08:51:08.859285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-04T01:22:54.356838Z","title":"Egovla: Learning vision-language-action models from egocentric hu- man videos.arXiv preprint arXiv:2507.12440, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28394","last_updated":"2026-08-01T08:11:08Z","snapshot_observed_at":"2026-08-06T23:11:29.841318Z","submitted_at":"2026-07-30T15:48:16Z","title":"Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T01:22:54.356838Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2607.28394"},"observation_digest":"sha256:311532f089f19cf8926143355c4a8015773535e58fd9635077ae70e0f13ceb01","observation_id":"0726349b-97cf-43ef-854b-8890bac421c7","resolution":{"observed_at":"2026-08-04T01:22:54.356838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12440/citation-record","integrity":"/paper/2507.12440/integrity","json":"/paper/2507.12440/citation-record.json","paper":"/paper/2507.12440"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vuong, S","venue":null,"work_id":"9aa6aa6e-5257-42d4-a510-79a325f15245","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:9ca0c0398ad8e8e390d4ba1be04f9f83b2489d6e666108764b13906797e5e679","observation_id":"0ed6bc88-415e-4e99-aafd-20845899eef2","resolution":{"observed_at":"2026-05-21T04:32:58.930156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Khazatsky, K","venue":null,"work_id":"0b81df8f-0617-42c7-8440-74c0e9aa90b0","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:fe9301004985440b433c653ff6f112f3222804e990b438d3f30380fa123febd0","observation_id":"9c44f7f5-a543-4b4c-a5a6-bddec513fd05","resolution":{"observed_at":"2026-05-21T04:32:58.933745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07870","last_updated":"2024-03-12T17:58:38Z","snapshot_observed_at":"2026-07-06T17:43:27.034067Z","submitted_at":"2024-03-12T17:58:38Z","title":"OPEN TEACH: A Versatile Teleoperation System for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2403.07870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.07870","snapshot_observed_at":"2026-07-04T15:59:56.304871Z","title":"OPEN TEACH: A versatile teleoperation system for robotic manipulation.arXiv preprint arXiv:2403.07870","venue":null,"work_id":"dc16bd4c-680b-4a5d-8b4a-98dbaad437a9","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2403.07870","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:053b480ac2993f73b4fa1d21afcc4ab82955942d36deb1c5f8c77cba6ebde0a6","observation_id":"c93141f6-9c67-4065-9b40-fefb354c28be","resolution":{"observed_at":"2026-05-21T04:32:58.791730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07869","last_updated":"2024-03-21T19:57:46Z","snapshot_observed_at":"2026-08-05T23:12:49.157287Z","submitted_at":"2024-03-12T17:58:01Z","title":"TeleMoMa: A Modular and Versatile Teleoperation System for Mobile Manipulation","version":2},"cited_work":{"arxiv_id":"2403.07869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.07869","snapshot_observed_at":"2026-07-04T04:49:34.794205Z","title":"Telemoma: A modular and versatile teleoperation system for mobile manipulation","venue":null,"work_id":"1abf02d0-5c6a-449f-b1ac-9da9b8da1a5c","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2403.07869","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:b996ffefaabc4989ca929b0fc338860be82b40adb22cd61a2aaed2eaa09702e4","observation_id":"8b923843-f2b7-45a8-87c7-0eba72127999","resolution":{"observed_at":"2026-05-21T04:32:58.788177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"70d87165-d655-4a7a-b489-4cd68fe8fe8e","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:027470c78a5e1f4e5e233170c577e2f72ee0ceef04018c48db79ed055984db29","observation_id":"a640a85a-966f-49b3-b0a0-79ee35a61d48","resolution":{"observed_at":"2026-05-21T04:32:58.935393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a14fa294-2513-4453-a59d-cadabdeb47c5","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:0af98965c6e6c1516825ff14a6cf5ec2cf285426386e6ba3a9d741aca9a9d6f5","observation_id":"aab5372b-9d8d-49ba-a048-16f4e16b30bf","resolution":{"observed_at":"2026-05-21T04:32:58.936997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fang, H.-S","venue":null,"work_id":"235e7baf-54ce-41ff-8fbb-1d18e80df531","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:ce9a2d38f0d9e432d4cad86812b125a29263a0b132bd02dc4f6df42bad3d1212","observation_id":"7b4ddec7-c528-4651-8ff7-608598c44a8a","resolution":{"observed_at":"2026-05-21T04:32:58.938826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6846c621-1adf-4c6d-95fd-0bec331458b8","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:755b288e71bd5dd6ba7dbff29b463ebb3df5082f89b2bff08a7f4b6550518c0e","observation_id":"ada99f2f-06e6-4937-9026-67a493d30ded","resolution":{"observed_at":"2026-05-21T04:32:58.940601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Naceri, D","venue":null,"work_id":"e6e99544-1e02-436e-bf55-c87cfa9e1fba","year":2021},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:658054716f3471322b9a7d564ad9af19e180b69776b3a4813513ca2a00c06d69","observation_id":"1bae9bd2-4dd4-49de-997e-52e812636c92","resolution":{"observed_at":"2026-05-21T04:32:58.942466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01512","last_updated":"2024-07-08T16:59:38Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:55:35Z","title":"Open-TeleVision: Teleoperation with Immersive Active Visual Feedback","version":2},"cited_work":{"arxiv_id":"2407.01512","doi":"10.48550/arxiv.2407.01512","metadata_source":"pith","pith_arxiv_id":"2407.01512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-television: Teleoperation with immersive active visual feedback","venue":"cs.RO","work_id":"4ca95dbb-b2bd-4e89-bb4f-6230e5b80db2","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2407.01512","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:6ea9e94200a010edd80f6c9a3b2af4628d2325c9dc724e871a1382d7c1c4e835","observation_id":"9032e7d9-70bc-48af-be0e-d67cbcff8383","resolution":{"observed_at":"2026-05-21T04:32:58.795129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03162","last_updated":"2024-07-03T14:35:35Z","snapshot_observed_at":"2026-08-03T10:58:14.357760Z","submitted_at":"2024-07-03T14:35:35Z","title":"Bunny-VisionPro: Real-Time Bimanual Dexterous Teleoperation for Imitation Learning","version":1},"cited_work":{"arxiv_id":"2407.03162","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03162","snapshot_observed_at":"2026-07-09T09:26:08.830087Z","title":"Bunny-visionpro: Real-time bimanual dexterous teleoperation for imitation learning","venue":"cs.RO","work_id":"11d37e8e-b726-4cf4-aeb7-79d5c7b08c23","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2407.03162","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:16881c9cc2a583592a54bd9a85a122ea27e788dcab44beba5d6a98ff025a9f1c","observation_id":"23390a69-66f6-41a6-931b-fa9e32351cba","resolution":{"observed_at":"2026-05-21T04:32:58.816737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2403.16169","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaze-guided hand-object interaction synthesis: Benchmark and method","venue":null,"work_id":"ed5271d9-d29f-4a63-86c2-0af95c4c29dd","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:5ef42f2c9f5bcf757bf15b78013d2514889da29a26ced1b2afe3a37bacfa8298","observation_id":"d32eb02a-43ed-4527-b766-9bf74f0ff7f4","resolution":{"observed_at":"2026-05-21T04:32:58.820398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ghosh, H","venue":null,"work_id":"cc6685da-141a-424f-8958-74f069071878","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:6db410ff24f84aa6dc4cc77d0241e7d0560765975793d0dd88d82dd1e678c2db","observation_id":"0ee0858d-8750-4c2c-85e8-21a43172222c","resolution":{"observed_at":"2026-05-21T04:32:58.944070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"50db0480-e7f9-4708-a156-2e020e044720","year":null},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:2871311470052fa0e0370a198ae59e712f53ab4f86a985f69bbc3892f9fdd257","observation_id":"d76022e1-97c2-4756-b9e5-95ff04cc5f06","resolution":{"observed_at":"2026-05-21T04:32:58.945844Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Black, N","venue":null,"work_id":"dfa585aa-09e2-4b49-8dd0-e51deddc5f8f","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:28e87c45781f529578c3c39acfbacd708a7bbc26345bbfbab65d877a7c9f6e76","observation_id":"e5db4faa-709d-4796-8112-becec2c57d6a","resolution":{"observed_at":"2026-05-21T04:32:58.947603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brohan, N","venue":null,"work_id":"61260f81-6205-47f8-85a7-57166c479e0c","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:8099f03212240c718b500a2901497e34f04b5403d5a23c6f9ea29bd40d1ee25e","observation_id":"1573cea1-701d-47a8-ac5d-8790141f15b4","resolution":{"observed_at":"2026-05-21T04:32:58.949241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Isaac sim: Advanced simulation for robotics development","venue":null,"work_id":"fb1062ab-f48a-4a10-8bf0-806d983f4240","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:92fd2e5a234a5e926c904c9cc1709d1d770604209506642f14ae626fcfba41b9","observation_id":"3b146c72-5b74-48c8-bed7-50e10250e9fd","resolution":{"observed_at":"2026-05-21T04:32:58.951081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Romero, D","venue":null,"work_id":"585da6d5-9aed-4840-940e-def2a73ba48d","year":2017},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:c0b5f4f0afcffcf500a1807e77a7d83617b51d021a9d0bcf1fe8cd07ef8a309f","observation_id":"bdcdb99b-d1c1-497a-86e9-fd906deb400b","resolution":{"observed_at":"2026-05-21T04:32:58.952952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rodriguez, M","venue":null,"work_id":"c6df97fc-650f-4ce4-ba32-0c561cb0dd37","year":2012},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:c4972d29af0feff6757ed15cafeb99119afe73269afcad40bf724df64ea98c5c","observation_id":"9539cc4c-6c4c-4019-a970-da5e8b7ff12b","resolution":{"observed_at":"2026-05-21T04:32:58.954859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rosales, R","venue":null,"work_id":"82e88673-720f-4963-ba62-443b8935b6dd","year":2012},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:fb53be2af1c545a3932b3121a359fc1eca015904abc8545026c2b7f229e8c3c0","observation_id":"7dfe254e-eabd-4e75-a992-e1a46506b1f6","resolution":{"observed_at":"2026-05-21T04:32:58.956752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prattichizzo, M","venue":null,"work_id":"bfb626d3-56ac-4c1b-ab52-e8f702c2f5a1","year":2012},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:8b396cd86d4ece7ea62745d4a95db98b9eb28f8fe711495d99809c2cdc82f62f","observation_id":"f871a194-e135-4782-8743-cc76b36d39f5","resolution":{"observed_at":"2026-05-21T04:32:58.958403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ponce, S","venue":null,"work_id":"40ee172e-8633-485d-947a-6b124a61fd03","year":1993},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:c4de0fe805d6754d582c843997806f441f04d7c391f1162cf922d0f33dcb7145","observation_id":"2b979ad0-6171-4519-abce-ddcb2843364b","resolution":{"observed_at":"2026-05-21T04:32:58.960051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ponce, S","venue":null,"work_id":"36d2702d-4249-40cc-aa27-55798b46990d","year":1997},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:409b8182be4a60e036ac45300b83bfd4f9cd74d3d82a07140b6e86e5569710f7","observation_id":"a79c1865-d90a-44e4-ac4a-9e723cbd5e2c","resolution":{"observed_at":"2026-05-21T04:32:58.961753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zheng and C.-M","venue":null,"work_id":"14c81787-178c-49b4-bf1c-046309363b8f","year":2009},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:f4ec14f282c6b3dbc9fad8a25de8270d16df4feeab7f9277a9c781c4951a7097","observation_id":"811a25d3-444d-4074-8465-009786708e4f","resolution":{"observed_at":"2026-05-21T04:32:58.833025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6a6b38d3-28e0-46ae-a3b4-081043d771ab","year":2018},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:e598c9ed43f60332f28ef18b24c8fbd5abb6cfe1e6c95926b839e9b7a5e7f2b3","observation_id":"e7ad1e08-c8bf-49f2-8c5e-ae013f93e608","resolution":{"observed_at":"2026-05-21T04:32:58.835302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"19d3fdd4-fa6e-4285-b4d0-df31285246c7","year":2020},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:c0f600395353f09483d1e166a2ed1c8a83e7241a99c7fb035e8a90f54d5c612f","observation_id":"038af182-6a54-4ba4-a5e9-e0af5dbf2429","resolution":{"observed_at":"2026-05-21T04:32:58.838469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nagabandi, K","venue":null,"work_id":"44ad5fbd-942b-4546-8cd2-22bdc2e7c88c","year":2020},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:f489fe021620886898558060651039f184ae73edaaa28d9ef9a5bf2a818d302e","observation_id":"1238de21-5c5e-4e1e-86db-2dd1c7005122","resolution":{"observed_at":"2026-05-21T04:32:58.840439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jiang, S","venue":null,"work_id":"e98dab26-5a86-415c-9c00-7f09bedb87f9","year":2021},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:1a9170eaed5de59b4de43157b0cc92ae8de7fa90c9d24368dc7541f44435b447","observation_id":"8a6a568e-ff5e-48ec-8e50-196e0d7136ca","resolution":{"observed_at":"2026-05-21T04:32:58.842310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Corona, A","venue":null,"work_id":"86cd8712-c2c1-407d-aa45-817517b29dd7","year":2020},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:2196b7e64f27b7167e16adb3f336d0522fe30df985d25a22617c4303d39f624c","observation_id":"36b87ba5-ec61-4175-a493-59555a067100","resolution":{"observed_at":"2026-05-21T04:32:58.844244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e4103956-c5d5-4236-a37f-d0e5e8e3c1bb","year":2021},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:7e8351f8352f03b52a3b87b9f936596d3296f5e85a2dc0a2d01766159608956a","observation_id":"1e57fd03-f052-41d9-a27e-db9a4e676531","resolution":{"observed_at":"2026-05-21T04:32:58.846223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3a3a57aa-0603-4795-aa66-d023ea88230e","year":null},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:cb261cf7d8637c9660753285ab4aeab1e5d7d3984301d01a06d8f90c4ccc3de1","observation_id":"613eea68-9074-4920-a4be-7060e7de6a3c","resolution":{"observed_at":"2026-05-21T04:32:58.848122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"66560f31-8d70-4eae-8f88-bb241b6f271d","year":2022},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:7553f29be77dbca1e3505dc263f4e306e0ef38ff0fd4b017fe1ae6b5f043954b","observation_id":"8f0b2e07-4e1b-43aa-bdd2-04947160a258","resolution":{"observed_at":"2026-05-21T04:32:58.850149Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brahmbhatt, A","venue":null,"work_id":"bedab9f9-3f1c-4d82-a6bb-c44f467a983d","year":2019},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:76ac108d8294cc68ccb387f509c12961ab44cc8264f333e4385c8e35817961b4","observation_id":"98748107-6853-49e5-b002-d5e8b398b198","resolution":{"observed_at":"2026-05-21T04:32:58.851971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Turpin, L","venue":null,"work_id":"64130b30-1b93-4df6-a2b2-34e0b1e6f4e2","year":2022},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:072038eaa93b5c8972d77624685583bf4045bf6b5657682b44af7d22a6239b36","observation_id":"9e2bc1f8-2562-49bf-bf0f-53cc8645c3e2","resolution":{"observed_at":"2026-05-21T04:32:58.853991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d9349b4a-58d3-4afe-914e-18e771cd0a33","year":null},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:7a1da9ef6f8ae9840bfd941552d76b352d7023f4448aa5efc0f7e8192debc723","observation_id":"35db358e-6c79-48ff-9af3-c40788dbeff2","resolution":{"observed_at":"2026-05-21T04:32:58.856005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.13441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.558223Z","title":"Yoon, Ryan Hoque, Lars Paulsen, Ge Yang, Jian Zhang, Sha Yi, Guanya Shi, and Xiaolong Wang","venue":null,"work_id":"5105d696-60c7-4b64-97d8-a65aa9cebde8","year":2025},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:ed611a5922d7c039a0ebda9bc5cc4438261c44faae3e4f281e3f4828dd97a273","observation_id":"0baa12ed-e81e-4785-9fb6-4e04cce48a93","resolution":{"observed_at":"2026-05-21T04:32:58.799201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24221","last_updated":"2024-10-31T17:59:55Z","snapshot_observed_at":"2026-08-05T13:48:05.430048Z","submitted_at":"2024-10-31T17:59:55Z","title":"EgoMimic: Scaling Imitation Learning via Egocentric Video","version":1},"cited_work":{"arxiv_id":"2410.24221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.24221","snapshot_observed_at":"2026-07-10T18:47:31.552848Z","title":"Egomimic: Scaling imitation learning via egocentric video","venue":"cs.RO","work_id":"92a2f39f-9dd2-401e-a854-aab6064581f0","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2410.24221","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:792a3aaced15a0899127beed49dfd8739640f54c1b7475a8b2f27cb2c048f48e","observation_id":"7f6ecd0f-6c98-428b-a03e-ef603ccb88c4","resolution":{"observed_at":"2026-05-21T04:32:58.802658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Achiam, S","venue":null,"work_id":"57e3f30a-6936-48e8-a5e7-4139d7dd1722","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:8331cc84626ba4aa923342cfdfed2c5f300964d28f615279a32a251c0a9efe34","observation_id":"b31a7f52-4eb5-4ff9-bab5-1545dae98eff","resolution":{"observed_at":"2026-05-21T04:32:58.857851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4af59671-82f6-487a-9651-e0528c0aac6d","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:ba5b1354d2eb114f4ec7d61ac7d48f74ebda20c8d89a2729a47503e16c3a9f33","observation_id":"865a6579-9aae-404e-961d-abe09e76db61","resolution":{"observed_at":"2026-05-21T04:32:58.862966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"17d20d81-4c18-4109-820f-c32288364478","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:8b94dafe89ba547839988f015289b3dc5af92e9f9eb189421f75fa47485d6749","observation_id":"16ae8019-65d2-430c-9454-ff145993fb34","resolution":{"observed_at":"2026-05-21T04:32:58.865027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pratt, I","venue":null,"work_id":"a886a4c3-47ba-4873-8ae9-48c9a29fee19","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:e51e1f8d7a9e06b41a52f31c36ef24e1b299899f9af6a95ec395b13b5a9cc67c","observation_id":"9b81d31d-b7ad-44c8-abe3-376da3b75bc4","resolution":{"observed_at":"2026-05-21T04:32:58.867350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alaluf, E","venue":null,"work_id":"c3c7891d-c552-428b-b7e8-c6b8fe85b17e","year":2025},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:2c2c278d3834ed3b58612edce6d6ec3e97211e50cb9783e7a4e3bdd97ab53031","observation_id":"e4eaae4f-6425-4526-9d66-077d003cf108","resolution":{"observed_at":"2026-05-21T04:32:58.869525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2f309a54-5847-4e3a-9443-4db2b65e9743","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:dd6078c05dd3a5d8c59569cbbc0044bfa0e4792b13573693950674c193cfdfe1","observation_id":"eab2daca-4438-4827-afb3-4ff0a3abaca6","resolution":{"observed_at":"2026-05-21T04:32:58.871297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Huang, S","venue":null,"work_id":"d2ca90e0-996b-4812-941e-6ac1d371ff79","year":2025},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:06e2529f26302324a3ca587b2a1abc4cecfacfa72467e58bc27c0792705f283b","observation_id":"b3bab134-7c4d-4926-918e-e615bab6e6e1","resolution":{"observed_at":"2026-05-21T04:32:58.875025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"442ff9a1-c7c7-4d29-9a00-7fdafd639693","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:d8faf729d06de713e258a7c001d348926e64a18b4584d8f27c7a6aa5daa135b0","observation_id":"7e40dc2c-45d6-4952-be4a-661bde1a0830","resolution":{"observed_at":"2026-05-21T04:32:58.876850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4b898e5b-12f6-465a-9795-bab915251465","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:3ad30fd6e59c0520cec13bf27b35ef7f0addcdfbc119453d4a0c5ba5697b7c16","observation_id":"25767cf3-3856-497e-9de7-3690fe020f14","resolution":{"observed_at":"2026-05-21T04:32:58.878581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:a18cfe8609b452bf3627d09a227c0d7ccd83d6743a994d50f84adb4d43c73eb0","observation_id":"c250a78b-7295-4aad-a829-6045709cac23","resolution":{"observed_at":"2026-05-21T04:32:58.770684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mandlekar, Y","venue":null,"work_id":"428cc9dc-40e2-4cc0-b408-48ead9144cbf","year":2018},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:de8ee7abae884177406bb90a114562d1eab604df3588cef151055d6971ad05d5","observation_id":"7dba06be-5bb9-4ac7-8204-ee09a4721e96","resolution":{"observed_at":"2026-05-21T04:32:58.880503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mandlekar, S","venue":null,"work_id":"a8e5bcb2-b42e-4b51-ae27-62931c9d11df","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:63e6c6dd13de75d582984eb6b8bbd08c44b003b7c6c2755f8a34ab7c329409d0","observation_id":"d125605d-8cfc-48de-a49d-ff9bff0b9ac2","resolution":{"observed_at":"2026-05-21T04:32:58.882214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dasari, F","venue":null,"work_id":"517d908d-4d95-40ec-995f-a52d28b9c209","year":2019},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:fc610ff5195a29ff6e50af59b1c20aa233f0e286da8b4b2261161c83f5e72132","observation_id":"00f86eea-1d94-48df-bc8a-7c31ac50b801","resolution":{"observed_at":"2026-05-21T04:32:58.883934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kalashnikov, A","venue":null,"work_id":"27f71180-d195-4d65-af83-ac3086a3c4b8","year":2018},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:c14225056db2d86ac37e597fccd0d688f35f1c96da5e9b68c2f993f9558d749f","observation_id":"fb0f664c-479b-41ba-a2e6-643f98d96d53","resolution":{"observed_at":"2026-05-21T04:32:58.885838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Damen, H","venue":null,"work_id":"465d1719-f1c1-4085-99a8-26c1a4b2cf21","year":2022},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:619d9bfcdf5be5fccc5392864dbe396566f600b4c237393a81b82291eca720d4","observation_id":"c9a26a40-af76-4340-a70a-fc35b26658f6","resolution":{"observed_at":"2026-05-21T04:32:58.887833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0e6411b8-ef33-4a36-8ada-5caf7d08008e","year":2018},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:315cb983ee9dd50b8ac08a64d961934089a595009cec34c086ad7e2a22dca5d7","observation_id":"1ef81e9b-4bf1-4f77-9598-24af79387c88","resolution":{"observed_at":"2026-05-21T04:32:58.889544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"327674c3-38c6-43a2-a215-a53bc29f82b6","year":2015},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:722e0391f58a1216140e7e160968d6d59e9e241b2dc9e8d71b63e1f56625708b","observation_id":"b0bba765-2663-4f9a-8912-f94e8ad932a4","resolution":{"observed_at":"2026-05-21T04:32:58.891383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grauman, A","venue":null,"work_id":"88f5030e-b99f-4e47-8fda-441dfb28e8f7","year":null},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:03b1b5530df4bca77bef126a2c7df375ed93f0c8c7ec084a49563b2e710b0d2f","observation_id":"c2894ad7-535c-48ec-8c1d-ada1371d6031","resolution":{"observed_at":"2026-05-21T04:32:58.893655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grauman, A","venue":null,"work_id":"9445004e-d77f-42cf-8130-c67e9f1c2e6b","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:c930bdcbad4e180f95154de7dadf61c192068bb1f9d2bba9743484847248da24","observation_id":"276e07fc-29d1-405e-b6fe-7d69ceadd9fe","resolution":{"observed_at":"2026-05-21T04:32:58.895517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mahdisoltani, G","venue":null,"work_id":"47a85958-a9d7-4d60-a203-7ef6d72bcda6","year":2018},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:068cb7c54cfffa52e34a818cf604d67beaf2aef2dc2d7c718a8e780b87c82550","observation_id":"4eaf3de1-56dd-4111-82f6-250aef88e7a4","resolution":{"observed_at":"2026-05-21T04:32:58.897184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Damen, H","venue":null,"work_id":"c1e453a6-0810-46fa-94c0-1babec499c53","year":2018},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:82d5b519381ecb912a6659175ed25a1e106d1f07094565cc1b71f76bfd628b41","observation_id":"3e26c793-cd4e-4c95-9fa6-29d38e2a2e54","resolution":{"observed_at":"2026-05-21T04:32:58.898988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"47b7ab4f-30a3-4121-b0d7-1e04bf0f2edb","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:dfd497c3e61c2eca386006347af33d664cd1ef9f4ca3b41e7c2f0811fb976ec8","observation_id":"bde0bcb1-1ce9-4257-99b0-554f30c9b210","resolution":{"observed_at":"2026-05-21T04:32:58.902881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef29b6d3-df63-4ea7-af0d-c050e7284ea2","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:1b924ff0b6e5aa226eefc1b589ee2a5a7f1b80cdbf1bbe7e44ad37b230917ff3","observation_id":"709e3014-4166-4e07-9d2d-b58736559dc5","resolution":{"observed_at":"2026-05-21T04:32:58.904780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2203.12601","doi":"10.48550/arxiv.2203.12601","metadata_source":"pith","pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":"cs.RO","work_id":"1fb6c1b7-913d-4a89-bbad-842fdb5fca1d","year":2022},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:4c777ac7db73f075379636c0bbed0ad84843217392cabe00701746b4b7db7ec8","observation_id":"f91308d9-9a25-4f82-9dfd-7b17254ed7ee","resolution":{"observed_at":"2026-05-21T04:32:58.805832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Majumdar, K","venue":null,"work_id":"58705155-9790-49d5-95f5-fa0eead58e93","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:beb3ad1cadf82ab3c2a76d07a9f3e76a20b9552f4fcc2b497d7058d3eb17d88d","observation_id":"f2633556-5944-414a-97cd-90aa1509c3bd","resolution":{"observed_at":"2026-05-21T04:32:58.906632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Karamcheti, S","venue":null,"work_id":"a011cddb-015b-4570-a7e4-e56c666dcca5","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:9916dad2ce01e38589926c682c8cd377fde4239333ad215b75b7ecfa5f576adc","observation_id":"17691082-9687-4709-a809-a9494f6760e0","resolution":{"observed_at":"2026-05-21T04:32:58.908375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05304","last_updated":"2024-11-21T17:45:43Z","snapshot_observed_at":"2026-07-06T17:41:34.856417Z","submitted_at":"2024-03-08T13:33:00Z","title":"Spatiotemporal Predictive Pre-training for Robotic Motor Control","version":4},"cited_work":{"arxiv_id":"2403.05304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.05304","snapshot_observed_at":"2026-07-03T11:48:04.894842Z","title":"Spatiotempo- ral predictive pre-training for robotic motor control,","venue":null,"work_id":"6d406605-69c2-4fb1-b024-accc3d24ce83","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2403.05304","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:17838295cc338b1d681ae948cf93c3115675d09f0457a7cd8247eb4214595bfa","observation_id":"6b35b50a-abcc-4d3d-8c11-6daeeeac83e6","resolution":{"observed_at":"2026-05-21T04:32:58.823660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00439","last_updated":"2024-06-01T13:28:31Z","snapshot_observed_at":"2026-07-06T18:23:48.473551Z","submitted_at":"2024-06-01T13:28:31Z","title":"Learning Manipulation by Predicting Interaction","version":1},"cited_work":{"arxiv_id":"2406.00439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00439","snapshot_observed_at":"2026-07-03T11:48:04.874848Z","title":"Learning manipulation by predicting interaction","venue":null,"work_id":"4625251e-2431-4bbd-bd8a-444001206e76","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2406.00439","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:3424683ab3c567f51dd91372e958d6c1acb8b30e8dfc484100c8703e82163a2d","observation_id":"dd9b74d3-11c6-42be-86e6-da0f5e495af5","resolution":{"observed_at":"2026-05-21T04:32:58.830323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:ffcf4ba3ffcdd4d33a3aac3c2712e5618246b368ca40ef1f8ab1ed1af6f86485","observation_id":"162c26cd-a0a7-4313-83cb-fec5c051812f","resolution":{"observed_at":"2026-05-21T04:32:58.826620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lirui, C","venue":null,"work_id":"cc8ffbac-f9d6-4bf3-9c87-ba7883966b90","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:c8626a13c6a9b9ad4b850eb1f5116f7a67e2f0e716ec9bbc3a0688b941619654","observation_id":"a3e33c1f-b5b8-42cd-b82c-98ab774ed1f7","resolution":{"observed_at":"2026-05-21T04:32:58.910710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:5bb56a60a6e072465838ff5fc76a52e682e716cf73391c8d866b0bdd1f6f11e8","observation_id":"e3b33f33-822a-4f75-b31c-5aaa08be4c8f","resolution":{"observed_at":"2026-05-21T04:32:58.776597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07035","last_updated":"2020-06-08T21:29:08Z","snapshot_observed_at":"2026-07-06T07:21:45.898421Z","submitted_at":"2018-12-17T20:13:17Z","title":"On the Continuity of Rotation Representations in Neural Networks","version":4},"cited_work":{"arxiv_id":"1812.07035","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1812.07035","snapshot_observed_at":"2026-07-04T19:40:06.063620Z","title":"Available: http://arxiv.org/abs/1812.07035","venue":null,"work_id":"a25b153e-71d0-49a8-88b4-caf811ccc1a0","year":2018},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/1812.07035","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:bd0c267c4b2acd3f9d669263c7c12dfb5853544c04ee63c7804977be22b79b1d","observation_id":"9ffaaa22-2da9-45f5-a5df-aee42c07c9b0","resolution":{"observed_at":"2026-05-21T04:32:58.780219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":"2405.05941","doi":"10.48550/arxiv.2405.05941","metadata_source":"pith","pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","venue":"cs.RO","work_id":"7f4ca6cb-1b94-454c-9623-b52441b74b61","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:55637ee7be5102e9ab756739ffecee90637e2ceef025b111c0b08e51d1f878a7","observation_id":"7ac3faed-88bc-4171-87c8-d9726ec89d29","resolution":{"observed_at":"2026-05-21T04:32:58.784465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.327003","doi":"10.1109/lra.2023.3270034","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Orbit: A unified simulation framework for interactive robot learning environments.IEEE Robotics and Au- tomation Letters, 8(6):3740–3747, June 2023","venue":"IEEE Robotics and Automation Letters","work_id":"a8f97f14-bf36-4ce0-9d28-0e3377d76357","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:0002a550c4324655138f8b5b888159a5836b1ae2f28f4b2ce79ab34bdd261ec9","observation_id":"3e4ffae3-17a8-4163-8553-271383b92846","resolution":{"observed_at":"2026-05-21T04:32:58.765652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T22:20:35.459149+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T22:20:35.459149+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bbae1db9-6bfc-41e6-b5db-5401be2f217d","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:db2328336bfa9d9606916de8276f31fff7e30c25aded436b20bc979b9f88fc00","observation_id":"435674a3-24b8-4773-843f-ad7925994291","resolution":{"observed_at":"2026-05-21T04:32:58.912751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robotics","venue":null,"work_id":"36122699-e1e8-4367-baa7-822bcaf7f3e0","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:b7ad1d4fb7e28b825e7a461a38a4c115c8bd590e498bf6ba9e0f828714462e38","observation_id":"e6f1e820-eb4b-4566-bfdf-602ac649fd5a","resolution":{"observed_at":"2026-05-21T04:32:58.914497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6ab8cefd-fca5-4d65-9441-c4290df3e370","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:2e36d2548eb41ab888707885ecf2b22860627d05ecfdc12c8fd461f656097ecf","observation_id":"7e58ed22-46f9-4e21-b05f-e05154f06b29","resolution":{"observed_at":"2026-05-21T04:32:58.916409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aaf32512-123e-4a10-8a3e-e212ebe93cf3","year":2022},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:4a06cc9728cb69bf267c9262f62265805c90a5cd93c7d62401ddbb0d78ee7b7e","observation_id":"658dc08a-a6d9-4897-b482-b56c658884d7","resolution":{"observed_at":"2026-05-21T04:32:58.918483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"19a1f6f4-0994-43c1-8b36-a16dd78dd5b8","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:6218564ab05d602dcedb68e6601ba0903d276171eb5650aba05e727ae303b970","observation_id":"86371c3f-7f10-4e18-ba62-39d56061c571","resolution":{"observed_at":"2026-05-21T04:32:58.920523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc33ea20-6341-4ae3-a352-a02a447a99ac","year":2022},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:ff6a635b673694d8663af551bfeb2580f55091c441c72edcaf119ed3824d668c","observation_id":"3f450265-fcd6-4a08-b940-2dd66dbf4a27","resolution":{"observed_at":"2026-05-21T04:32:58.922162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08399","last_updated":"2024-03-25T16:50:43Z","snapshot_observed_at":"2026-07-06T17:16:13.055978Z","submitted_at":"2024-01-16T14:41:42Z","title":"TACO: Benchmarking Generalizable Bimanual Tool-ACtion-Object Understanding","version":2},"cited_work":{"arxiv_id":"2401.08399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08399","snapshot_observed_at":"2026-07-03T11:38:05.098134Z","title":"Taco: Benchmarking generalizable bimanual tool-action-object understanding","venue":null,"work_id":"906b0a4a-032c-454c-b733-aa811f0cf66f","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2401.08399","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:48d5016991c76051644147752e59a448de90c89677650d3d4c7fd87f56580c1c","observation_id":"6bd75f0f-7626-47c2-880c-6b59314dc797","resolution":{"observed_at":"2026-05-21T04:32:58.809560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09598","last_updated":"2024-06-13T21:38:17Z","snapshot_observed_at":"2026-07-06T18:30:41.802045Z","submitted_at":"2024-06-13T21:38:17Z","title":"Introducing HOT3D: An Egocentric Dataset for 3D Hand and Object Tracking","version":1},"cited_work":{"arxiv_id":"2406.09598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09598","snapshot_observed_at":"2026-07-08T05:34:32.414139Z","title":"Banerjee, S","venue":"cs.CV","work_id":"4f3adc8d-0053-4df7-985f-42142d1ccd99","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2406.09598","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:66e3db60a1558e52550af6375a972b91c14e939d619cc3997513e3f4bdcbfdaa","observation_id":"e0d8c426-7f7d-4c62-8b9b-a8c896f144c2","resolution":{"observed_at":"2026-05-21T04:32:58.812986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oquab, T","venue":null,"work_id":"6d5a5179-11fd-4309-abb8-c668ce1a6495","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:02d0339f12b844e078e94112fa16a8156e3184cdba2a4af1fb45bf322423a3ae","observation_id":"30c213a6-8018-4c72-ae15-738af907cb88","resolution":{"observed_at":"2026-05-21T04:32:58.924023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Darcet, M","venue":null,"work_id":"827ecfb5-4569-480f-83c1-0e2bd20a2d2a","year":2023},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:99754bc29145bfde108db4a4cd5a490e44958f1d47798a68a5b9a376fe785fd7","observation_id":"d737640d-a9a3-4478-8500-6b90a9fd273f","resolution":{"observed_at":"2026-05-21T04:32:58.925776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nvidia omniverse: A platform for virtual collaboration and real-time simulation","venue":null,"work_id":"e2bb11d2-9101-4313-8e8d-c705139d6a0f","year":null},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:36a259ec64ce79cd3a1672faef7e0a003940c24369b425c649140b1f6130089f","observation_id":"d2fc7b23-a0d4-44d6-b283-0acab4b130f8","resolution":{"observed_at":"2026-05-21T04:32:58.928341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"22 14 Appendix 1 Dataset Details Language Label: The combined dataset includes ego-centric RGB visual observations, wrist poses, hand poses, and camera poses","venue":null,"work_id":"9001ed83-f3cd-4d67-9029-977dc4658e86","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:7b782c3c61d90d308e45deeeab867674a08a89f071e1ae0c691d64f3f2d634a6","observation_id":"2e1729d2-b841-4302-83cc-4fd095e8512b","resolution":{"observed_at":"2026-05-21T04:32:58.932077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":18,"verified_fuzzy":41},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 72 inbound Pith citation observations for arXiv:2507.12440."}