{"as_of":"2026-08-06T14:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c22dddf6ab07ecda77b279426dc276771b9add334a3b8c48fc8cf0681bc5e374","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":73,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:43:23.688296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:04:26.214499Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:197c8ae4d5bc5e4b03e0222e92b27005082e1d3e74aec2d60db37ac255e50cc8","observation_id":"4b663d66-8493-4372-a97a-1ac02bb8f69b","resolution":{"observed_at":"2026-05-17T21:37:50.804809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-05-12T18:38:11.110166Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2412.14803"},"observation_digest":"sha256:855d594ff5e4c23c34c8ea3cbbf976c833644c8fa75a202eda1d8a00e6a3b264","observation_id":"718d15f3-c66f-4a6d-a748-ef6c9ce207ec","resolution":{"observed_at":"2026-05-12T18:38:11.375731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:a4c09deb4aa45a95b80b01b5c3986452130b7a8b98be0ecbf82d789e2f82d05a","observation_id":"57cfbfcb-8c20-4ce7-95b9-c5e853cb1f70","resolution":{"observed_at":"2026-05-11T08:52:32.103559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T16:25:00.365534Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2504.02792"},"observation_digest":"sha256:34b7e3e731b211772b4d67dd84fd7b54cdf053c4919841cc58a2f0a46188338d","observation_id":"74dea9bf-a527-4cd8-a62e-b4c62ecff04c","resolution":{"observed_at":"2026-05-13T16:25:00.423827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:2248c9fdd768f53ee483a31e8dc4bcdb343218f5197fbf1c2e4c13c56c052e63","observation_id":"59f40fba-6a85-41f2-8871-64a387c25b0b","resolution":{"observed_at":"2026-05-17T20:55:52.344513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2505.07813","last_updated":"2026-05-17T22:14:58Z","snapshot_observed_at":"2026-07-06T21:22:45.982350Z","submitted_at":"2025-05-12T17:59:05Z","title":"DexWild: Dexterous Human Interactions for In-the-Wild Robot Policies","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T15:21:21.778285Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2505.07813"},"observation_digest":"sha256:c4a8fe92e09d4bf003a04882f1971eb665b004ec6d2d4d932dcbee454a301642","observation_id":"08f125d6-899a-48d4-b885-4a3582659e75","resolution":{"observed_at":"2026-05-22T15:21:44.551116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2507.00990","last_updated":"2026-05-13T01:35:48Z","snapshot_observed_at":"2026-07-06T21:50:35.488353Z","submitted_at":"2025-07-01T17:39:59Z","title":"Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations","version":3},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-19T06:36:13.144868Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2507.00990"},"observation_digest":"sha256:e825294a6b95315ed080272feadd26f8a6d1d7177e8ca815a1c5420b9e1d2c57","observation_id":"f7a95971-8812-4ce4-ad0a-c9ddd885922a","resolution":{"observed_at":"2026-05-19T06:37:07.309359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-06T11:32:06.287734Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:ffcf4ba3ffcdd4d33a3aac3c2712e5618246b368ca40ef1f8ab1ed1af6f86485","observation_id":"162c26cd-a0a7-4313-83cb-fec5c051812f","resolution":{"observed_at":"2026-05-21T04:32:58.826620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:67e5501b2a181b584cae0ff41d5fb5afc0dd1fc1474e1ca96a333e2c8ac0f71a","observation_id":"d871c39a-369c-4474-83b8-32bcff3a5751","resolution":{"observed_at":"2026-05-17T08:04:12.611143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T21:52:02.893886Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2507.23682"},"observation_digest":"sha256:411109713d0732fc1be90cca52fae041d584ef3715a10098348f05c3889a660d","observation_id":"422b08cf-3e20-458e-8975-68ca0fa933fd","resolution":{"observed_at":"2026-05-15T21:52:03.172957Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-05T18:43:23.688296Z","title":"Can vision-language models complete popular video games⋆ 2025▷ ♭Online♯▷ Available","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2508.14293","last_updated":"2025-08-19T22:19:04Z","snapshot_observed_at":"2026-08-05T18:43:21.541145Z","submitted_at":"2025-08-19T22:19:04Z","title":"Search for a Heavy-philic W' Boson using Proton-Proton Collisions at Center-of-Mass Energy of 13 TeV Using the ATLAS Detector","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T18:43:23.688296Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2508.14293"},"observation_digest":"sha256:fc9aa9304b970d661e1a68032f30f995fa5c393292eeef2d645d198853c5536c","observation_id":"c892f0a5-ee12-4a77-862d-73d35dd75a6e","resolution":{"observed_at":"2026-08-05T18:43:23.688296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-05T13:46:41.391260Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00361","last_updated":"2025-08-30T04:53:32Z","snapshot_observed_at":"2026-08-05T13:46:39.182535Z","submitted_at":"2025-08-30T04:53:32Z","title":"Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-Top Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:41.391260Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2509.00361"},"observation_digest":"sha256:75f7cd71169ccf83652c9168cfbdab212ec0d0ce298640bc2c09a221881b7771","observation_id":"ebcfce30-e81e-449d-a0f6-1bf1ddd6b4d4","resolution":{"observed_at":"2026-08-05T13:46:41.391260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-03T20:59:53.272765Z","title":"Latent action pretraining from videos.arXiv preprint arXiv:2410.11758,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:53.272765Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2511.17502"},"observation_digest":"sha256:2f114cb598027760a23b5639df4cc55433a209d839bc09dead4a91e82a2dc7b1","observation_id":"ca132bc9-fcf8-499f-8499-0959806fb879","resolution":{"observed_at":"2026-08-03T20:59:53.272765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T10:41:00.142543Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2512.15692"},"observation_digest":"sha256:5e840a5aaa9ba0fdf28f578c32b354548a394374cc6bfa4ec402ea69d90902b8","observation_id":"783b014c-5ef7-4a13-8c2a-707be2221463","resolution":{"observed_at":"2026-05-15T10:41:00.246660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2512.24497","last_updated":"2026-05-18T09:26:59Z","snapshot_observed_at":"2026-07-31T22:57:41.701920Z","submitted_at":"2025-12-30T22:50:03Z","title":"What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-21T15:33:24.616338Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2512.24497"},"observation_digest":"sha256:0236c412ce1751331d547fbc86c58eb04c7e9c09dd00460ac8389fa7f97e345f","observation_id":"4cd1a96b-5b5c-4cad-8be9-8ed27698a72d","resolution":{"observed_at":"2026-05-21T15:34:15.028858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-03T05:21:39.528682Z","title":"Y., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02762","last_updated":"2026-07-02T00:32:14Z","snapshot_observed_at":"2026-08-06T03:52:18.184889Z","submitted_at":"2026-02-02T20:13:43Z","title":"On the Sample Efficiency of Inverse Dynamics Models for Semi-Supervised Imitation Learning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T05:21:39.528682Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2602.02762"},"observation_digest":"sha256:7bd258e70eb24f36c732eb945731cfc43927b438a33cb43db5f17fe6178d9f8f","observation_id":"557db13a-c2fd-4172-80ca-9f1dacb3b113","resolution":{"observed_at":"2026-08-03T05:21:39.528682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T02:28:37.997148Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2602.11075"},"observation_digest":"sha256:c7342fd82ffb5b82d93e90fa492c4bf09df723c35c9ebe02a1ec387c9ad6aa13","observation_id":"2cc0af82-5331-4aff-8017-07f87a689b9d","resolution":{"observed_at":"2026-05-16T02:30:32.079195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-02T22:41:10.969247Z","title":"Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.16229","last_updated":"2026-05-25T05:51:24Z","snapshot_observed_at":"2026-08-02T22:41:03.647765Z","submitted_at":"2026-02-18T07:08:14Z","title":"Factored Latent Action World Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T22:41:10.969247Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2602.16229"},"observation_digest":"sha256:bed7348f8a110c1d89353192b928839b6755ba347415bede590710a444672209","observation_id":"e9cbe408-a726-4645-a5ac-a24067eae156","resolution":{"observed_at":"2026-08-02T22:41:10.969247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2602.20231","last_updated":"2026-04-09T04:26:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-23T18:41:41Z","title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:31.988002Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2602.20231"},"observation_digest":"sha256:5012c49cd1a84fa73948c929ccdca3d8c79874573e9ff6f91d91af1b7c168f63","observation_id":"4bcec5a9-7bee-4993-b2ab-4b2af87ba99f","resolution":{"observed_at":"2026-05-15T20:20:17.696163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-13T14:03:01.974171Z","title":"Latent action pretraining from videos.CoRR, abs/2410.11758, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":272,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:bdf09646587e62705c3ccdc6b45d076c23a1b98fa298ad0e9c56a449c0094b10","observation_id":"281fab71-0799-48f0-ab05-7e4219056cad","resolution":{"observed_at":"2026-07-13T14:03:01.974171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.04974","last_updated":"2026-06-03T17:05:28Z","snapshot_observed_at":"2026-08-05T03:49:14.637609Z","submitted_at":"2026-04-04T15:37:11Z","title":"From Video to Control: A Survey of Learning Manipulation Interfaces from Temporal Visual Data","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-13T17:02:18.358675Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.04974"},"observation_digest":"sha256:cf37136c3c6e8e1db4222fb02f6354e2aea922be5bb752e8cdc9de96a88be2cb","observation_id":"c6dce25b-abb2-410d-9f86-122ab52e8761","resolution":{"observed_at":"2026-05-13T17:03:01.026422Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-07-13T08:25:19.322550Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T17:07:41.489995Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:b4886eac51b7fed331c1c3828f834cda8865284a81b29f84acefe4306c08b9c0","observation_id":"95c70fb4-f443-4072-8c9d-4748730cf6d0","resolution":{"observed_at":"2026-05-11T07:35:56.946457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-13T08:25:22.011013Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.07607","last_updated":"2026-07-07T17:04:24Z","snapshot_observed_at":"2026-07-13T08:25:19.322550Z","submitted_at":"2026-04-08T21:27:06Z","title":"EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T08:25:22.011013Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.07607"},"observation_digest":"sha256:925353260697fdd734499afeb2178f82412d17e6e2c518a4d6352b1472bfc89c","observation_id":"bfe5ab6b-e649-4b48-b065-68b3c60dd5e9","resolution":{"observed_at":"2026-07-13T08:25:22.011013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.13645","last_updated":"2026-04-15T09:14:43Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:14:43Z","title":"A Mechanistic Analysis of Sim-and-Real Co-Training in Generative Robot Policies","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T12:29:38.306670Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.13645"},"observation_digest":"sha256:2e2f2afdbce138b2c648acf9c448148f22b8cccaf0030021c9b67a22155551af","observation_id":"af5bd6a6-0072-47f5-9d62-9bd55e0a02cd","resolution":{"observed_at":"2026-05-10T12:30:22.742733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T11:42:34.409651Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.15483"},"observation_digest":"sha256:ffdc0cf108f201df0c802f7e2eab9ea3c722c911394b58a1366bc039342aabce","observation_id":"ed6fc1aa-5a18-4638-9451-f87cd753eeb2","resolution":{"observed_at":"2026-05-10T11:45:21.748452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T03:02:26.084185Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:7784f6be6fec9cab765a3109bbcead66480409c970bad584eb7d516a633bb451","observation_id":"5feb4b7b-0335-40b3-8c38-b354eac17ea1","resolution":{"observed_at":"2026-05-10T03:03:37.436932Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T06:15:32.881140Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:aa5919ff0c35621517281f549aa2b940ddb6c5c1b112b2e3e92a7aeaa7252409","observation_id":"d2e47202-b52d-4623-ab11-734bc07b01f5","resolution":{"observed_at":"2026-05-15T06:19:50.224025Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:a9ff7b3e42ff2465ce76cb5faadc4b12f2c6ef616bc8908313344a9369970c85","observation_id":"95635ea6-2ab6-4671-aa50-56262d2d12c1","resolution":{"observed_at":"2026-05-11T13:16:06.498105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.21741","last_updated":"2026-05-05T16:01:35Z","snapshot_observed_at":"2026-07-29T22:30:00.899443Z","submitted_at":"2026-04-23T14:42:54Z","title":"Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-09T21:26:26.540403Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.21741"},"observation_digest":"sha256:756673b5eb2a74dd22b310527df7bf36667b48a6adfb43bc71ca83ef4f1a86a0","observation_id":"a2f3427d-62f4-44b1-814c-c769af1995ca","resolution":{"observed_at":"2026-05-11T14:36:07.485520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.22615","last_updated":"2026-04-30T12:27:46Z","snapshot_observed_at":"2026-07-06T23:09:01.221922Z","submitted_at":"2026-04-24T14:46:03Z","title":"GazeVLA: Learning Human Intention for Robotic Manipulation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-08T11:37:30.784513Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.22615"},"observation_digest":"sha256:fe0b8f50c727e887135f8f17420ca6a3fd0d6185e40526fb29b83ae040b6301b","observation_id":"4f55cb2a-6e1f-4117-8e63-e78b2d38aac7","resolution":{"observed_at":"2026-05-11T19:36:12.842343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2604.27448","last_updated":"2026-04-30T05:43:10Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T05:43:10Z","title":"LA-Pose: Latent Action Pretraining Meets Pose Estimation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T08:57:27.503349Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2604.27448"},"observation_digest":"sha256:c5db267ea51c0fcc824d833014afb93f7778cfe2a495ddf5066a4b12edd213c5","observation_id":"b659df27-96a0-4d02-a1ce-c5190e908742","resolution":{"observed_at":"2026-05-12T09:51:28.799831Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-09T20:48:01.461993Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.00078"},"observation_digest":"sha256:259e848e5305176cbc8b4245ef3175e564b9943c39a3226d08f3a3414dc19d87","observation_id":"ab75a691-8c4e-4a04-b1b0-9be9c5be6d59","resolution":{"observed_at":"2026-05-11T14:56:08.337677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.01694","last_updated":"2026-05-03T03:19:42Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T03:19:42Z","title":"Latent State Design for World Models under Sufficiency Constraints","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T15:55:31.825583Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.01694"},"observation_digest":"sha256:39bb82753e213221b17f9bfe64b03faa0f61dffcccb5e8f77f1819a4c7c18bba","observation_id":"53e5e099-6103-47b3-973e-8486b028db50","resolution":{"observed_at":"2026-05-11T09:36:04.583192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.03637","last_updated":"2026-05-05T11:09:41Z","snapshot_observed_at":"2026-08-02T21:37:36.029720Z","submitted_at":"2026-05-05T11:09:41Z","title":"Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T15:44:25.021995Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.03637"},"observation_digest":"sha256:f70b235da3ae91e322fd19660049653eb4458a49bb60de680e875e6443099970","observation_id":"fc4ada06-80e7-4344-95ab-7ce18c2cf58b","resolution":{"observed_at":"2026-05-12T11:01:31.461201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.04678","last_updated":"2026-05-06T09:27:07Z","snapshot_observed_at":"2026-07-06T23:17:23.641984Z","submitted_at":"2026-05-06T09:27:07Z","title":"From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T17:43:00.453164Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.04678"},"observation_digest":"sha256:ffe5669560db713deb78471343439b434e710cf33a8aad277903ba025bf7d29e","observation_id":"a64c4529-209d-4c34-ace1-8a7ef737fec8","resolution":{"observed_at":"2026-05-11T17:16:09.847697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.06222","last_updated":"2026-05-09T10:59:29Z","snapshot_observed_at":"2026-07-31T22:35:22.553259Z","submitted_at":"2026-05-07T13:18:28Z","title":"When to Trust Imagination: Adaptive Action Execution for World Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T09:17:18.017938Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.06222"},"observation_digest":"sha256:3881d37ef41b1d6ae8e816fbeec02e4a2f05ab12822abb4502e32220c2a25c5f","observation_id":"7bab4f9d-daa8-4fb9-a197-cd5319671327","resolution":{"observed_at":"2026-05-11T20:21:13.052348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.06222","last_updated":"2026-05-09T10:59:29Z","snapshot_observed_at":"2026-07-31T22:35:22.553259Z","submitted_at":"2026-05-07T13:18:28Z","title":"When to Trust Imagination: Adaptive Action Execution for World Action Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:22:49.557507Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.06222"},"observation_digest":"sha256:db40da356f80f76fb5ca03b42ca500da19ba2b9c82cd3f7ea4b7af2dc7e75a1c","observation_id":"be29d844-acc0-4621-9048-b9d923f4e127","resolution":{"observed_at":"2026-05-12T08:01:31.404350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.06298","last_updated":"2026-05-08T08:40:29Z","snapshot_observed_at":"2026-08-03T00:38:32.482207Z","submitted_at":"2026-05-07T14:02:00Z","title":"Render, Don't Decode: Weight-Space World Models with Latent Structural Disentanglement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T13:39:05.969414Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.06298"},"observation_digest":"sha256:4fba2c8a2d422f580eb0d1949c074364fbbc7bb237e249899f46fbd9e01796e0","observation_id":"ee50c076-a6d5-4c52-bf2b-18b7207e9672","resolution":{"observed_at":"2026-05-11T18:51:07.838477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.06298","last_updated":"2026-05-08T08:40:29Z","snapshot_observed_at":"2026-08-03T00:38:32.482207Z","submitted_at":"2026-05-07T14:02:00Z","title":"Render, Don't Decode: Weight-Space World Models with Latent Structural Disentanglement","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:46:31.004068Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.06298"},"observation_digest":"sha256:c93599c802e1150ca808ba844bdb6379ebd09aa819209f8ec530ed8691c2544c","observation_id":"d942fe46-0322-41ba-9368-dba678739730","resolution":{"observed_at":"2026-05-11T04:20:58.598501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.09613","last_updated":"2026-05-10T15:51:01Z","snapshot_observed_at":"2026-07-06T23:21:39.966502Z","submitted_at":"2026-05-10T15:51:01Z","title":"SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:08:29.524972Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.09613"},"observation_digest":"sha256:4fada1d2fd3425efe624f2cf149dfe199a17da44c5c5a4ba1d17a614218c5a1f","observation_id":"94b943df-dd28-46ef-a51b-ab29e5546782","resolution":{"observed_at":"2026-05-12T06:36:26.268876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.10819","last_updated":"2026-05-13T09:16:02Z","snapshot_observed_at":"2026-08-06T08:57:29.338706Z","submitted_at":"2026-05-11T16:37:07Z","title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T04:14:54.885244Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.10819"},"observation_digest":"sha256:386cf9ee6b02c3a4332eabeb58dc5e4efdf7de9e826262ed253892bf29db53d1","observation_id":"345855cf-2400-471f-9695-6726e08eff02","resolution":{"observed_at":"2026-05-12T06:26:26.843140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.10819","last_updated":"2026-05-13T09:16:02Z","snapshot_observed_at":"2026-08-06T08:57:29.338706Z","submitted_at":"2026-05-11T16:37:07Z","title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T21:14:56.501485Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.10819"},"observation_digest":"sha256:d6b37f668b56bc17fd9b4ef87d29cdaac470e421af3514267276b0bf24a18efb","observation_id":"9e2b3200-77ed-44d5-8a4c-74ace4c3b1fb","resolution":{"observed_at":"2026-05-14T21:17:59.574580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.13403","last_updated":"2026-05-13T11:58:02Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T11:58:02Z","title":"RotVLA: Rotational Latent Action for Vision-Language-Action Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T17:48:06.734816Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.13403"},"observation_digest":"sha256:5e2d885c0cc74dd43bb84bf01d8814b5c3db6775b2c08f8ae6bc03271fe5dcda","observation_id":"50fb0860-61ce-4703-b3c6-16998b91ec14","resolution":{"observed_at":"2026-05-14T17:49:23.117129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.13452","last_updated":"2026-05-13T12:48:23Z","snapshot_observed_at":"2026-08-02T06:31:23.659104Z","submitted_at":"2026-05-13T12:48:23Z","title":"CUBic: Coordinated Unified Bimanual Perception and Control Framework","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T19:06:13.250054Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.13452"},"observation_digest":"sha256:2c53cdc18bf793dd814a1fc124c1746d1126b7953de4f5de94bc98890e30e611","observation_id":"34f3fdd2-3ef4-4666-9f7e-78083bfac972","resolution":{"observed_at":"2026-05-14T19:07:51.118404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.15725","last_updated":"2026-05-15T08:22:37Z","snapshot_observed_at":"2026-08-06T08:15:14.018564Z","submitted_at":"2026-05-15T08:22:37Z","title":"DiLA: Disentangled Latent Action World Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T19:35:37.527479Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.15725"},"observation_digest":"sha256:de8aea3ca0587945f45cc59ec5620cddf2088b0d1fdc6eb971772bc07de27d37","observation_id":"9d077384-3d62-4f57-a49a-0e2e233766a6","resolution":{"observed_at":"2026-05-20T19:38:56.304993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.30326","last_updated":"2026-05-28T17:57:15Z","snapshot_observed_at":"2026-08-02T13:47:40.639700Z","submitted_at":"2026-05-28T17:57:15Z","title":"RoboWits: Unexpected Challenges for Robotic Creative Problem Solving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T07:06:10.838225Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.30326"},"observation_digest":"sha256:c0ca01f1b6aa87c380a7fa2a98bb15d994b74256fdf2721c48b80c9bc8384a1b","observation_id":"8517292a-d71d-47b9-ae81-f425017c7507","resolution":{"observed_at":"2026-06-29T07:13:16.894631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2605.31234","last_updated":"2026-05-29T12:36:30Z","snapshot_observed_at":"2026-08-01T07:47:47.447472Z","submitted_at":"2026-05-29T12:36:30Z","title":"HARP-VLA: Human-Robot Aligned Representation Learning for Vision-Language-Action Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:04:09.296855Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2605.31234"},"observation_digest":"sha256:b9386068b2999734b573f33f7e3d65513d741cf6177f18e12c55179a54849d3f","observation_id":"35ba7f4b-76ac-43b1-8817-eabe773a0b30","resolution":{"observed_at":"2026-07-01T19:46:10.862338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.04130","last_updated":"2026-06-02T18:40:24Z","snapshot_observed_at":"2026-07-06T23:44:19.059079Z","submitted_at":"2026-06-02T18:40:24Z","title":"CLAW: Learning Continuous Latent Action World Models via Adversarial Latent Regularization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T09:55:00.402411Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.04130"},"observation_digest":"sha256:73faf342a95c49cda6335017c9a7c34e534e5cee7e52f372e1a73db03defed18","observation_id":"f1738901-b194-4700-a8bf-8b503e193eaf","resolution":{"observed_at":"2026-07-02T03:36:29.608591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.06556","last_updated":"2026-06-04T10:43:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T10:43:14Z","title":"Robots Need More than VLA and World Models","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-06-28T01:01:33.530167Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.06556"},"observation_digest":"sha256:8e4ac039deae0b8d9f363e1aa72a9419e2d3cd3893ed84a4c1f4b2e0ed819d10","observation_id":"4391f14c-a5c0-42de-8237-3ce75bbd106e","resolution":{"observed_at":"2026-07-02T13:46:59.186305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T22:25:17.522240Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:2a64dd2218fa29df38bf5df2946180f4091f00290d878e81796a378b0873c57f","observation_id":"7b69703f-24b7-4b53-85b7-a1b029ff7cc9","resolution":{"observed_at":"2026-07-02T16:47:09.516655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-01T07:17:42.045939Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:6818276c04c2a6f79ab64473491b73a2eef4086d261614ddb462515d456cdaa8","observation_id":"7884fe78-56fe-497d-9805-d85f4d4f8ced","resolution":{"observed_at":"2026-07-01T08:35:34.475835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.08657","last_updated":"2026-06-07T14:53:28Z","snapshot_observed_at":"2026-07-06T23:48:07.065806Z","submitted_at":"2026-06-07T14:53:28Z","title":"Latent Diffusion Policy: Shaping Latent Spaces for Diffusion-Based Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T18:28:06.679879Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.08657"},"observation_digest":"sha256:b426ddf1e19274d360a91b6c2c1e87b934a67d756f589cea437e627a89a4c7b2","observation_id":"948bdecb-550b-4f81-a356-b599cd920636","resolution":{"observed_at":"2026-07-02T23:07:26.991234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.10025","last_updated":"2026-06-08T18:08:01Z","snapshot_observed_at":"2026-08-03T02:41:00.793549Z","submitted_at":"2026-06-08T18:08:01Z","title":"GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T16:10:40.130366Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.10025"},"observation_digest":"sha256:45b002805dd6d5a66407050def4b6fd36348d70599304618e6b282bc1d7ca79d","observation_id":"90730065-0f09-4da3-80ab-3d3352ee0464","resolution":{"observed_at":"2026-07-03T02:07:33.565797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.17256","last_updated":"2026-06-15T20:00:20Z","snapshot_observed_at":"2026-08-01T18:51:15.199353Z","submitted_at":"2026-06-15T20:00:20Z","title":"Contrastive Action-Image Pre-training for Visuomotor Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T03:16:33.702802Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.17256"},"observation_digest":"sha256:c3e50932059ff8a6315a8e3ada1198125a3eb5a48a0deadb17345046a9a615df","observation_id":"ceacc4e4-9757-4a90-82c6-c6eea57beb09","resolution":{"observed_at":"2026-07-03T18:08:46.891731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.17924","last_updated":"2026-06-16T13:38:03Z","snapshot_observed_at":"2026-08-04T20:30:44.313843Z","submitted_at":"2026-06-16T13:38:03Z","title":"PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T00:57:58.312567Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.17924"},"observation_digest":"sha256:0f0ba341c749413611c6df664eda0d6da11cd3722914bce2e7b17cba508a4818","observation_id":"8a17dfe7-1109-40ea-9c7e-46f3469a7fdc","resolution":{"observed_at":"2026-07-03T20:58:58.523547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T21:53:27.323112Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:411e2b05d36b79f14efadb06d726651b441ffd22b2860ad391193b138830f3dd","observation_id":"a2d622b1-7f9d-4fb1-b214-fdf4b3103f76","resolution":{"observed_at":"2026-07-03T23:39:04.279675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.18955","last_updated":"2026-07-02T03:31:37Z","snapshot_observed_at":"2026-08-02T05:51:00.160847Z","submitted_at":"2026-06-17T11:37:59Z","title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T23:44:35.238493Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.18955"},"observation_digest":"sha256:73cca7042ad1ac73eec8c1203d401010354e8350dc19ff706cd2e20bd0cec78b","observation_id":"f84b4399-2964-4786-994f-8c75f4e7438c","resolution":{"observed_at":"2026-07-03T23:49:01.879308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.20867","last_updated":"2026-06-18T18:54:51Z","snapshot_observed_at":"2026-08-03T13:52:03.831619Z","submitted_at":"2026-06-18T18:54:51Z","title":"FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:08.616612Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.20867"},"observation_digest":"sha256:bee3082ba0f8c27601d0247ec7e58dafb2ee4880ff582429da6faf3ccae14f8b","observation_id":"f5e9397d-83af-4da1-a90b-00efc767fa36","resolution":{"observed_at":"2026-07-04T03:29:30.436606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.21139","last_updated":"2026-06-19T06:24:05Z","snapshot_observed_at":"2026-07-06T23:56:12.374739Z","submitted_at":"2026-06-19T06:24:05Z","title":"PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T14:28:36.505775Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.21139"},"observation_digest":"sha256:6d0f76daa51d929ac5daebff5bec26d4fe2f863d731f2146139d9a5f91f4bdfc","observation_id":"6a3c773c-5550-4fa4-ae24-c45bc48b93a9","resolution":{"observed_at":"2026-07-04T06:29:37.214516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.21672","last_updated":"2026-06-19T18:23:24Z","snapshot_observed_at":"2026-08-03T01:20:08.680482Z","submitted_at":"2026-06-19T18:23:24Z","title":"Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T14:07:31.139419Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.21672"},"observation_digest":"sha256:f850344ace320dbb10a055b9d14072eba78b34d9125e27ea48e08cfec07ba6ba","observation_id":"bf443342-1d89-4983-89af-84090af3c5a4","resolution":{"observed_at":"2026-07-04T06:49:38.608997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.23685","last_updated":"2026-06-22T17:59:52Z","snapshot_observed_at":"2026-08-02T17:54:27.887583Z","submitted_at":"2026-06-22T17:59:52Z","title":"LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T07:58:17.225491Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.23685"},"observation_digest":"sha256:cd95a0018aa81cea751a7e7d40fb734c0b2a42b5de64f1d6218d41702d2e7ee6","observation_id":"46779f88-38c3-41d5-bc8c-b5003f920236","resolution":{"observed_at":"2026-07-04T11:29:50.787907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.26095","last_updated":"2026-06-24T17:59:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-24T17:59:56Z","title":"Learning Action Priors for Cross-embodiment Robot Manipulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-25T19:09:56.409766Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.26095"},"observation_digest":"sha256:110206bf7eaa54f6c15e66fbd8c07b9e106a7857391c204ff13b66b8b56b9751","observation_id":"ff049e46-0992-4cf3-95e3-0ce3bb58cbcb","resolution":{"observed_at":"2026-07-04T21:00:09.755926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.28133","last_updated":"2026-06-26T14:34:04Z","snapshot_observed_at":"2026-08-05T12:02:21.397136Z","submitted_at":"2026-06-26T14:34:04Z","title":"Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T04:23:04.622902Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.28133"},"observation_digest":"sha256:352d97b0dab50968423b75a7aa2f5962833780a52d2d3dc34be387cc4ef961af","observation_id":"c4a7442a-468c-41c6-b12c-3c8dc5c95e9a","resolution":{"observed_at":"2026-07-01T16:55:51.442636Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2606.30544","last_updated":"2026-07-31T04:12:07Z","snapshot_observed_at":"2026-08-06T03:57:26.826352Z","submitted_at":"2026-06-29T16:45:04Z","title":"Latent Actions from Factorized Transition Effects under Agent Ambiguity","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-30T06:00:35.407561Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2606.30544"},"observation_digest":"sha256:29607e46c98b33301cf69f46b0a595fcedefcb78ec45f88bbaae94836d9fb34e","observation_id":"039623ae-f676-429e-99f9-17c7b5ba3862","resolution":{"observed_at":"2026-06-30T06:04:21.449589Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2607.00678","last_updated":"2026-07-06T08:13:44Z","snapshot_observed_at":"2026-07-12T09:22:06.947773Z","submitted_at":"2026-07-01T09:21:20Z","title":"ABot-M0.5: Unified Mobility-and-Manipulation World Action Model","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-02T14:24:23.187164Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.00678"},"observation_digest":"sha256:8daf449b46805c873e4ac17d2ec6e2530820673abceeff9098bd924c5460a778","observation_id":"089d6f47-89a4-4eb8-84bf-89146babc735","resolution":{"observed_at":"2026-07-02T14:27:03.155846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-12T09:22:08.000379Z","title":"Latent action pretraining from videos.arXiv preprint arXiv:2410.11758, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00678","last_updated":"2026-07-06T08:13:44Z","snapshot_observed_at":"2026-07-12T09:22:06.947773Z","submitted_at":"2026-07-01T09:21:20Z","title":"ABot-M0.5: Unified Mobility-and-Manipulation World Action Model","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-12T09:22:08.000379Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.00678"},"observation_digest":"sha256:ec457c7194575f6987c8052c888cfaae1be2be6558838403b81a7c8d3da9179e","observation_id":"ec100e60-b7b2-4e42-99bb-c4a79f5d3ece","resolution":{"observed_at":"2026-07-12T09:22:08.000379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-11T14:43:12.450611Z","title":"Ye, S., Jang, J., Jeon, B., Joo, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04714","last_updated":"2026-07-06T06:34:14Z","snapshot_observed_at":"2026-08-02T11:48:11.459254Z","submitted_at":"2026-07-06T06:34:14Z","title":"Geometry-Aware Motion Latents for Learning Robust Manipulation Policies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:12.450611Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.04714"},"observation_digest":"sha256:89da366c236b83c1b66d92ad419081eef94d2ba89546f56614e32d06f6f56a02","observation_id":"1f49447e-5467-4902-921e-85dd27b3df2c","resolution":{"observed_at":"2026-07-11T14:43:12.450611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-11T13:05:32.374206Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04816","last_updated":"2026-07-06T08:50:05Z","snapshot_observed_at":"2026-08-06T09:25:11.270935Z","submitted_at":"2026-07-06T08:50:05Z","title":"CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T13:05:32.374206Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.04816"},"observation_digest":"sha256:c49d9a18841fc8ba089fa30a62e8c110757f2ee54463a8f2817ba928e52198e8","observation_id":"43e43fbf-4d9f-4984-bf03-74544447af01","resolution":{"observed_at":"2026-07-11T13:05:32.374206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":"2410.11758","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-08T02:04:26.214499Z","title":"Latent Action Pretraining from Videos","venue":"cs.RO","work_id":"f32313d6-51a8-4863-8646-8e1870c15e2f","year":2024},"citing_paper":{"arxiv_id":"2607.06559","last_updated":"2026-07-07T17:58:15Z","snapshot_observed_at":"2026-07-10T23:18:28.634748Z","submitted_at":"2026-07-07T17:58:15Z","title":"RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T02:00:30.551638Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.06559"},"observation_digest":"sha256:6bdb9c63013efe2b79d6120059fda8cc0f2afa8e0d91a99b94c9ce7316ab30d3","observation_id":"88f73141-048e-4cc6-9507-421e773002ce","resolution":{"observed_at":"2026-07-08T02:04:26.215924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Latent action pretraining from videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:79cf228c633d36c7f86ba255474f2758a1df8a00aec13557f9db9b5af569432a","observation_id":"59bb24ef-efbe-433b-a9b7-d23c44443329","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-01T14:39:52.535448Z","title":"arXiv preprint arXiv:2410.11758 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-04T15:25:40.989347Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:52.535448Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:2ab5679bcc61450ca0bc250760c547480436b10afb0c620c166d72368a22f95c","observation_id":"0d1d8b2e-1fda-45dc-b515-a1acf0c57c53","resolution":{"observed_at":"2026-08-01T14:39:52.535448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-30T11:05:16.022725Z","title":"arXiv preprint arXiv:2410.11758 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27138","last_updated":"2026-07-29T17:09:48Z","snapshot_observed_at":"2026-08-04T22:29:50.278226Z","submitted_at":"2026-07-29T17:09:48Z","title":"DLAM: Distributional Latent Actions with Temporal Constraints","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-30T11:05:16.022725Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.27138"},"observation_digest":"sha256:eb52d44cfa7936a9a4b371469b89ecaea4302c33879d27218ad24283e0ea7492","observation_id":"1508b492-828f-45b8-883f-52994a9080f6","resolution":{"observed_at":"2026-07-30T11:05:16.022725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-04T19:45:35.397349Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-06T13:22:21.962637Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":282,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.397349Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:78be89e42591d744228c2fba62f89e9d63c37ef9d12b0a62f75c9e7a82815392","observation_id":"05fe152a-2587-4325-b096-f1af5b1967d0","resolution":{"observed_at":"2026-08-04T19:45:35.397349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.11758/citation-record","integrity":"/paper/2410.11758/integrity","json":"/paper/2410.11758/citation-record.json","paper":"/paper/2410.11758"},"outbound":[],"paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 73 inbound Pith citation observations for arXiv:2410.11758."}