{"as_of":"2026-08-06T21:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f818e7586cd6c1e7b7a85f299d7e4af1455c3cf1ed072f1a98ef9a216b1f4a11","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T23:44:35.238493Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.18955/citation-record","integrity":"/paper/2606.18955/integrity","json":"/paper/2606.18955/citation-record.json","paper":"/paper/2606.18955"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:56:59.442527Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"9898a490-983a-46cc-ad07-30f2e1ac1ad0","year":2023},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:987abf11b0488596fbada4b0cdb9cdb546ae3c642881a75ae2cc5f11e46b42b4","observation_id":"bb342532-56d7-42a3-b206-d119dd4d806c","resolution":{"observed_at":"2026-07-04T23:40:13.230888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:f9bc1d7913eb89af7c98fe37aef408b17c891080802665fd1b1f2ab3844b751f","observation_id":"5a28e0a3-7ee6-4467-8b14-3e60063ec3b3","resolution":{"observed_at":"2026-07-03T23:49:01.889233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":"2410.07864","doi":"10.48550/arxiv.2410.07864","metadata_source":"pith","pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","venue":"cs.RO","work_id":"12319725-bc7d-4c32-a229-ad270a7460bc","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:a531d9a041171377c75ec999f9a3e2606c82f5d3c97315a565bc8086813b0819","observation_id":"8aca3682-2511-48d3-a305-abda9e933487","resolution":{"observed_at":"2026-07-03T23:49:01.874547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:40:13.240019Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x- embodiment collaboration 0","venue":null,"work_id":"0f0ee4dd-04b6-476a-8328-f741997b3633","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:5f431eb9134290a78e1c8cc06d5fb45458ea8b8533b7a796a457bc9d3590f52c","observation_id":"96d87619-2dc6-41bf-8509-7a1e8fdfd306","resolution":{"observed_at":"2026-07-04T23:40:13.241648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":"2503.06669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-10T23:07:47.895730Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","venue":"cs.RO","work_id":"f797e9ec-510f-43a7-8a0c-18009ce332e5","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:6d976e8e077ba38021765f9508a31f273e84c1824e82d64a0a36bfd9a6424dfe","observation_id":"962c5af2-eb31-4847-a09f-fc5f0761e44e","resolution":{"observed_at":"2026-07-03T23:49:01.896471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:40:13.238163Z","title":"Egomimic: Scaling imitation learning via egocentric video","venue":null,"work_id":"6a814773-808b-4b8b-b933-2b7a3c7a7b22","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:fa604c5a0cb6b51b772abcb8961240eb5d4db4ce5a1de77bb63b85e37fcbd0e6","observation_id":"25881b6c-f5df-4391-9789-9d9294e7237a","resolution":{"observed_at":"2026-07-04T23:40:13.239467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17759","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.670608Z","title":"Motiontrans: Human vr data enable motion-level learning for robotic manipulation policies","venue":null,"work_id":"bb3cd721-89ee-428d-a8eb-5fb9a8370219","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:f5192bcfe004ba64d25a386c8ab3506a69a35011318d98a33f5980e0210ead00","observation_id":"baec75bf-216e-4c7f-a54a-623992b13991","resolution":{"observed_at":"2026-07-03T23:49:01.894675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23523","last_updated":"2025-08-01T06:30:43Z","snapshot_observed_at":"2026-08-06T10:47:54.256882Z","submitted_at":"2025-07-31T13:06:59Z","title":"H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2507.23523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.23523","snapshot_observed_at":"2026-07-10T18:47:31.665247Z","title":"H-rdt: Human manipulation enhanced bimanual robotic manipulation","venue":"cs.RO","work_id":"eed69612-81a9-49c8-811f-3696bfe4037c","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2507.23523","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:e8f29c893440f4006fde82e1f3109d9f0af5b144f904154c82b132b3e928c0be","observation_id":"68c83ee3-f061-42eb-b622-b81583aae9fa","resolution":{"observed_at":"2026-07-03T23:49:01.877582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:73cca7042ad1ac73eec8c1203d401010354e8350dc19ff706cd2e20bd0cec78b","observation_id":"f84b4399-2964-4786-994f-8c75f4e7438c","resolution":{"observed_at":"2026-07-03T23:49:01.879308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":"2411.00785","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-07-04T21:00:09.783700Z","title":"Igor: Image-goal representations are the atomic control units for foundation models in embodied ai","venue":null,"work_id":"b127536f-15a2-43f9-9edf-3ceb198ec554","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:51ef12935127ed93cfa7d9b751dd686d7f1d0af1964aa03e0c67312c84b352ef","observation_id":"f2cded77-958a-4ab6-a065-0eeb889d2748","resolution":{"observed_at":"2026-07-03T23:49:01.900671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.15691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:49:01.869847Z","title":"What do latent action models actually learn?","venue":null,"work_id":"ae16c6d2-9437-4415-8901-eb48f85a5dc7","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:8fd182729161b3f8251b798d4a68129645f6d02dcf297d181886d303208fb8b0","observation_id":"2423e44a-e6ba-4d25-8d5f-08ed83fbd2f2","resolution":{"observed_at":"2026-07-03T23:49:01.871582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":"2505.06111","doi":"10.48550/arxiv.2505.06111","metadata_source":"pith","pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","venue":"cs.RO","work_id":"e05d654d-db73-48f6-9318-381b6798bac9","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:d88710f8fc78ebf466799bf3fcca2bfbecab05531ff7eccfcdba79705eacb033","observation_id":"f51869ce-30bc-4a65-a8e3-86b2453ddd58","resolution":{"observed_at":"2026-07-03T23:49:01.881847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:9f5ef8e09db244a38698aff9dc2a61d2797e9827ac94b6b64034c9900062c99c","observation_id":"579d7492-c339-49a3-9486-d4cdcdfbede7","resolution":{"observed_at":"2026-07-03T23:49:01.899325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:8a8519c107ac1ac78bc5419ec9a430212fcba781b6edae8963fda6ccd78138f8","observation_id":"d047ecf8-978d-4991-9db0-dc9d176960d9","resolution":{"observed_at":"2026-07-03T23:49:01.903760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:56:59.444815Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"65728903-8c58-4f3a-87ac-b7060a43a8e7","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:834b1f1cfce43d6d6b37a48f3a30e23dc393448d4386f40caa7b43d5daf548ba","observation_id":"6133d7c9-625a-43c0-b8e5-61266fa3b3fe","resolution":{"observed_at":"2026-07-04T23:40:13.246257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:81516e8d89d3207170825a13c62b76d9a2d617f9b3e20717ea22d35b11b0fcb1","observation_id":"824544dd-455b-4142-a12a-5a01ccb88480","resolution":{"observed_at":"2026-07-03T23:49:01.889027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2507.23682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.23682","snapshot_observed_at":"2026-07-04T17:30:00.529444Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","venue":"cs.RO","work_id":"e4e687d7-64db-4ff4-8ddf-752b58365e0f","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2507.23682","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:1c53ecb0bd6df66df4dd8ff74a94ded05ccd7bb4faded44b4b9c4d0769683183","observation_id":"b374a28c-3af3-4724-8064-9ad02607aed8","resolution":{"observed_at":"2026-07-03T23:49:01.891429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:40:13.234578Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots","venue":null,"work_id":"b5246a93-34ad-4c8a-a146-9bbbfc9e13c8","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:aaae2b0d69ace50d1a5e5872942a5d9275919bc89a22e298c488a1d8fee1bc61","observation_id":"e831ddd6-8a35-48ae-a903-dd2dfc103e04","resolution":{"observed_at":"2026-07-04T23:40:13.235889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":"2304.02643","doi":"10.1109/iccv51070.2023.00371","metadata_source":"pith","pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Segment Anything","venue":"cs.CV","work_id":"2bbf46ca-720a-45a1-8e9c-10c33fbeada0","year":2023},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:4a5487d4a4d591a8f42d8ce88568a8021cb0bbe9dc8b5fd0c97a6fbc39ea2921","observation_id":"f5ba9d0b-e4cb-49be-8792-dc6820f2e1db","resolution":{"observed_at":"2026-07-03T23:49:01.886677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:40:13.226405Z","title":"Prismatic vlms: Investigating the design space of visually- conditioned language models,","venue":null,"work_id":"645842a5-fb9e-493e-9df4-e37affe24291","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:937a398fcb7c1cc54f8073d7b245018d9a3a9707d10a535fef05fd35f489bdc8","observation_id":"229b6af9-98a7-4b08-a783-682d4c61b499","resolution":{"observed_at":"2026-07-04T23:40:13.228346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:e20684268b778b83ea88097591f0940c30fc807ff66890dd13fd09aaaba5ada5","observation_id":"a65ac982-f3e9-490d-b482-7be63559fad7","resolution":{"observed_at":"2026-07-03T23:49:01.897292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:a132f0d1d17f43d30618bc8ecb817492f02a8c11d8ec83c19e147f3f15a1f05c","observation_id":"04ff4257-5693-487c-9e42-ed5017a8f3ea","resolution":{"observed_at":"2026-07-03T23:49:01.883254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:2f7245f342b7051b58f01fd79bbf76a076402e3181f3e3b5b9efa90a4a2c607d","observation_id":"975188d9-b63c-4a61-922e-67ceed4c0b18","resolution":{"observed_at":"2026-07-03T23:49:01.893940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:40:13.236415Z","title":"Bridgedata v2: A dataset for robot learning at scale,","venue":null,"work_id":"d3041f0d-080b-42f5-87de-480fdf32ca80","year":2023},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:aa1dffc7369f62d738dbf9216ac9c6933ba1e8783528bf44f35aa47f87bb94fe","observation_id":"b4e3148a-1276-46aa-b67a-925586bfd33d","resolution":{"observed_at":"2026-07-04T23:40:13.237616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:40:13.242235Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learn- ing","venue":null,"work_id":"0d8b3487-e7f9-49cb-9be5-165c6d2d1846","year":2023},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:b9dadb6e991593e660c74c87a5290eb786db29a26bf4377059b82fbc9b2672f3","observation_id":"ae6cbf74-cd35-43c2-aa91-0a3697f67341","resolution":{"observed_at":"2026-07-04T23:40:13.243732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18738","last_updated":"2025-07-13T02:18:02Z","snapshot_observed_at":"2026-08-03T05:41:49.125371Z","submitted_at":"2025-03-24T14:46:14Z","title":"RoboEngine: Plug-and-Play Robot Data Augmentation with Semantic Robot Segmentation and Background Generation","version":2},"cited_work":{"arxiv_id":"2503.18738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.18738","snapshot_observed_at":"2026-07-10T23:17:45.531917Z","title":"RoboEngine: Plug-and-Play Robot Data Augmentation with Semantic Robot Segmentation and Background Generation","venue":"cs.RO","work_id":"4137871a-2d1e-4b71-bea1-bb7add4c85e8","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2503.18738","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:6f66c7b0225114bf5f4dc516fe3780c4814c189bb213adaf6bad9ae5a3ac3090","observation_id":"e7cd1eda-e2f0-4e71-a07b-d71711045c2c","resolution":{"observed_at":"2026-07-03T23:49:01.869844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:e1eaa15833ecdcee6fdc6c3f381a5c24bc9b72c1bf304c2c64154746145b781c","observation_id":"148a5ba7-9175-4e64-820b-de5327d18669","resolution":{"observed_at":"2026-07-03T23:49:01.880331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":"2505.11709","doi":"10.48550/arxiv.2505.11709","metadata_source":"pith","pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","venue":"cs.CV","work_id":"4190fb9c-70e0-4388-aa0b-516589489047","year":2025},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:cff7b1b82143ecf372f40f8ea5c7e45b8a38f8b4eb989498afebe26635874843","observation_id":"551bc605-f877-4b8d-94e9-6ea46cb48e3c","resolution":{"observed_at":"2026-07-03T23:49:01.891877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T03:21:54.287986Z","title":"Furniturebench: Reproducible real-world benchmark for long-horizon complex manipulation,","venue":null,"work_id":"484cf01b-66e1-49e9-8a98-2d248e9c8c20","year":2023},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:8c9ce98f9b04d58022217930679566ccb31bd3bfa2f4245bf3fba51129f352ab","observation_id":"04f6150f-4924-444c-a45e-214a3e1ead4a","resolution":{"observed_at":"2026-07-04T23:40:13.225763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:30.902086Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":"a236f59f-dbd4-4a6f-ac92-ef7b61447925","year":2019},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:cf73a2df11ad7cd7c988a93f0721aa9d378f26eda153430f843f4b67e3a2f0d2","observation_id":"b3b6e15c-f670-4753-8908-0678d65b0790","resolution":{"observed_at":"2026-07-04T23:40:13.233943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":10},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2606.18955."}