{"as_of":"2026-08-05T00:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d5c0e33921c1c812e242854e9fa10680116155a0fd629f9d3452c78fbc1ec50","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T05:52:34.589171Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11397/citation-record","integrity":"/paper/2607.11397/integrity","json":"/paper/2607.11397/citation-record.json","paper":"/paper/2607.11397"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Siméoni, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:a9a5d5c7e1bedb26bcbdf3e60609adcef3ce9e5b3d9a289761bdcff51150cca8","observation_id":"e13f6412-e76a-491d-a514-5974249018dd","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Depth anything v2,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:e7497cfb2935736df8f910423cf0c11c6bd05c5cfb4054c900cad3f4809dfab3","observation_id":"409e3c19-06cf-4ffa-891b-bd889ee5365b","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-07-06T21:25:23.371749Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Egodex: Learning dexterous manipulation from large-scale egocentric video,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:40202471d87e3e04a643b2a7d3ac117329a865277344efdb1aeb2107bf97bf7f","observation_id":"a15d9ece-09f5-4fa5-b969-7da18dbe3a8b","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17441","last_updated":"2026-04-13T12:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T17:39:22Z","title":"RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.17441","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Robocoin: An open-sourced bimanual robotic data collection for integrated manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2511.17441","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:46cf73bbad3833f8931cf9c1f85c377d248782135da44800cfcc8b735f05373a","observation_id":"693c8148-6448-4a28-852a-30879f48ee49","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:37f956bf7f694ad8f3b68b68c07c24576876cecea1871cb086e7d3262a9754da","observation_id":"a04ded9e-f9bd-4821-9c43-87d8e9c28221","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Robocasa: Large-scale simulation of everyday tasks for generalist robots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:6f1b33e47cf94f1fbfc41da74b21c626b6b6b3a8346c61a27b585981e4a289e3","observation_id":"6aae0788-def2-4fb9-ab50-20ba9b9ee5ea","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:08539bb8fe52a0d195b1b41ad1c449fc0964b31e2b65e5aeac13dc8c8a56fd4f","observation_id":"4527748e-65b8-4904-ad8e-6775d6d91f0c","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:610e6160841af39a7f3bfd88174543c661fecd007417291c24fc88ea0161a183","observation_id":"0130bd01-cadf-4479-8120-f560a3cb7e40","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:da1bb026b66ebe8ea49720c25daa637dcbc389af80fb77f2db5d643a9234ba05","observation_id":"38929368-2b45-493c-bc76-698097edb913","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Octo: An open-source generalist robot policy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:21d03586904c47782621c9b28f429806d3f4240085a89970ee321346c02c2fc8","observation_id":"19b90573-6c63-4a67-b551-b9df87433143","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"π0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:f686690a5aed2f873b21059eaf7f312e04f3ee7b07e7beb7d1d5eedf0b5c97b4","observation_id":"0224757f-32b9-4aeb-b1b6-13e7010c3f64","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Available: https://arxiv.org/abs/2410.24164","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:25f5d293bd723ee59ba282880c61555c940a88276c1465c9a7a1710ba64dd51f","observation_id":"cdd1f35a-a47d-42fa-81fb-954f2e188e66","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Fast-wam: Do world action models need test-time future imagination?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:303bf0f81fbfbda224c66e9a2d6ec05de3ef79b30bbed1ea87be595d7eb6cfcc","observation_id":"6c9b1331-017e-47f0-96cb-78b8c9b13883","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Causal world modeling for robot control,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:d7460c00eccc4bf56f160534124fd1cf5a90703d477f73d17968f45703c17b3d","observation_id":"94a0c9c8-3670-45be-9e14-c3a5147e7001","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12215","last_updated":"2026-06-03T04:04:20Z","snapshot_observed_at":"2026-08-02T23:57:43.860710Z","submitted_at":"2026-02-12T17:53:51Z","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12215","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Lda-1b: Scaling latent dynamics action model via universal embodied data ingestion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2602.12215","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:cfd02a8eecd3f822927c16249301b1f7af9a7bfbb3be08f4a9edc6bd52cca794","observation_id":"9625656e-7c4b-40b8-acb9-2e7fda05eb94","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"World action models are zero-shot policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:413f08d2701ebfcbe5ad5472519d92ae8a30f4c523b721aa5f8905bc6a50f048","observation_id":"a1a21988-ddb1-4cae-a221-8c1dd96609ff","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Motus: A unified latent action world model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:698a3ae596d6a8392f3bcd88c44a23440dc38ce0987998f0e15a43cd32de9bbd","observation_id":"a8ddf504-e257-45e0-a1ad-54027e2d70ab","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-07-06T19:33:57.090585Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Latent action pretraining from videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:79cf228c633d36c7f86ba255474f2758a1df8a00aec13557f9db9b5af569432a","observation_id":"59bb24ef-efbe-433b-a9b7-d23c44443329","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Moto: Latent motion token as the bridging language for learning robot manipulation from videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:24df8834431ac3bc97be5b4e4735cb16339b64193c3e5050c56c80d5b3cebce1","observation_id":"4103b645-e698-4860-9693-bd739ef6c59d","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Univla: Learning to act anywhere with task-centric latent actions,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:6ef391adb94f5ca9a99600239aaf00dcd26b6aa2e758bbe2ea2db6b22be83ca1","observation_id":"c6393ffb-9f0a-4715-970f-f519d05edc6e","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Available: https://arxiv.org/abs/2505.06111","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:2ae97b9667782d18e1609e587946a6dffe26d5b27a93bf877728820980d8e043","observation_id":"340c69ea-265c-4627-b9ac-346ef3594dfe","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19734","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Unit: Toward a unified physical language for human-to-humanoid policy learning and world modeling,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2604.19734","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:c74a54018b3197761766a711a7cfe41235eda10891bd514675c9c3c286101ffc","observation_id":"0882fa01-a819-42df-8335-27a82fc14cfd","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23682","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"villa-x: Enhancing latent action modeling in vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2507.23682","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:2bac820553a44e49e236f28de9474bb975f335891c85febf2a41412d8be3f37c","observation_id":"1b21bf43-ba97-4099-a825-80c480399f5c","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:51710efa76bf92615b1b599d4127f6050713df5952a46b351b0038a8027a4052","observation_id":"9850e7a2-7e73-4f09-ae20-2f45c696c936","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"π 0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:9cb94a81259fa2849a3eb31e53fad3a95038b7ef9b8bc94dd2e060690702f3bb","observation_id":"ebdff35c-a361-4e3a-a531-07472ad81ea8","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"X-vla: Soft-prompted transformer as scalable cross-embodiment vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:0af566915246af50a4e729cd56b736a4c9139268b88d7973f583304e9d9b6263","observation_id":"4590de90-8d21-40b2-9f49-59f7c3510fa1","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11757","last_updated":"2026-04-13T17:30:01Z","snapshot_observed_at":"2026-07-06T23:00:03.762376Z","submitted_at":"2026-04-13T17:30:01Z","title":"StarVLA-$\\alpha$: Reducing Complexity in Vision-Language-Action Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11757","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Starvla-α: Reducing complexity in vision-language-action systems,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2604.11757","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:78c5217953fa67cce6089407c8a36f1cb2df4f5c224a73ba4f453d247a7fd401","observation_id":"8c1c41b8-d55a-49b9-9e6e-399c3d54419e","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Internvla-a1: Unifying understanding, generation and action for robotic manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:434cf578568f07d9871109cd2d1908203c5f9e9d06cc09a7077f67dec134c3f7","observation_id":"6d76f414-18a5-4d28-ae28-3d2d9491b22e","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Starvla: A lego-like codebase for vision-language- action model developing,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:46da80aac9d9c56445c9fd959cf8087333e7c4ae1b63c97d362bb169abe10e59","observation_id":"52a0440b-bfff-464e-b8ca-d995cfa3364d","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:152df067e1674d22f99b53ba051f88022eb695b40451281717d5dd6784069b00","observation_id":"d231e741-0f75-4edc-9e22-1e7fac3bf2aa","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Abot-m0: Vla foundation model for robotic manipulation with action manifold learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:474e06fa8ba4b0843c46344ae6db8d51039b3ad411051c2fa10205123040bf7e","observation_id":"14bbfdd0-4c0d-4537-b4d1-e77f57c3cfec","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03269","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Rldx-1 technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2605.03269","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:94c049da5cbe4842101ea9949e89c718effc20d220230300af0c473f8a30c1ca","observation_id":"2670a3db-1c2e-4455-a9d0-c1bffb91d88b","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13757","last_updated":"2026-05-13T16:38:05Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T16:38:05Z","title":"FrameSkip: Learning from Fewer but More Informative Frames in VLA Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13757","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Frameskip: Learning from fewer but more informative frames in vla training,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2605.13757","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:733d405b67cdd0007bb1b8f448ed791e060d5312d0496bfe2ce7881df069d0e0","observation_id":"284b221b-72d1-4f40-958e-52b4fd8ad0a6","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:cb006acc78ab62ee51446509ebf0cd8ae2be12dbf8243b288dda28d00a6328cd","observation_id":"63faa1a1-8b7c-45c4-bc74-99818282425f","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.29844","last_updated":"2026-04-28T02:10:56Z","snapshot_observed_at":"2026-08-01T00:31:11.395521Z","submitted_at":"2026-03-31T15:02:27Z","title":"DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.29844","snapshot_observed_at":"2026-07-14T05:52:34.589171Z","title":"Dial: Decoupling intent and action via latent world modeling for end-to-end vla,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:34.589171Z"},"links":{"cited_paper":"/paper/2603.29844","citing_paper":"/paper/2607.11397"},"observation_digest":"sha256:a9a0c48a68bdc0322561995afbea1b5517782160a642738bae86162adef54efe","observation_id":"f7bb466b-d7c2-499c-8d49-404f97cb8a5f","resolution":{"observed_at":"2026-07-14T05:52:34.589171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11397","last_updated":"2026-07-13T11:02:04Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T16:19:12.630473Z","submitted_at":"2026-07-13T11:02:04Z","title":"WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.11397."}