{"as_of":"2026-08-10T04:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3be1731eff5a653681385c4025b5dd32cc11ec49d554fcd83e875da69622ba88","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:33:00.314367Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03701/citation-record","integrity":"/paper/2608.03701/integrity","json":"/paper/2608.03701/citation-record.json","paper":"/paper/2608.03701"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-05T14:32:55.682090Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations.arXiv preprint arXiv:2412.14803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:55.682090Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:e4a1c61f98863a7cbc8b1638dc7496061f8dd60c188d2127c9cff631092819ac","observation_id":"e4f1b260-bb94-4513-beef-9c56dc3c9cc7","resolution":{"observed_at":"2026-08-05T14:32:55.682090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:33:04.001409Z","title":"Learning universal policies via text-guided video generation.Advances in neural information processing systems, pages 9156–9172, 2023","venue":null,"work_id":"8cf7052e-5609-4b7d-86cb-f80debba41d5","year":2023},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:55.754898Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:2335612b7ef94612d8ab1627617e8a5bd2e925f6e1497bc1ed9b7f8326f2ad16","observation_id":"1b303c24-7824-443b-b86a-3eebd33bfcf5","resolution":{"observed_at":"2026-08-05T14:33:04.087128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:33:03.793514Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation","venue":null,"work_id":"19a16500-9eaf-4e49-b081-487169d45f8c","year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:55.845802Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:e94566b9b4aac9f5888b9f51a746d139f57b483f0a726783a1e2137ddfb6f585","observation_id":"41cee179-4b01-488a-8a87-c0a40630b61b","resolution":{"observed_at":"2026-08-05T14:33:03.857544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01955","last_updated":"2026-06-01T09:14:51Z","snapshot_observed_at":"2026-08-03T02:17:56.167011Z","submitted_at":"2026-06-01T09:14:51Z","title":"WALL-WM: Carving World Action Modeling at the Event Joints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01955","snapshot_observed_at":"2026-08-05T14:32:55.957540Z","title":"Wall-wm: Carving world action modeling at the event joints.arXiv preprint arXiv:2606.01955, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:55.957540Z"},"links":{"cited_paper":"/paper/2606.01955","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:e233140ad880b85bc331657aeedfe6f074aa16dde7b81b515b23f23fa0e4e99b","observation_id":"ea629a24-5700-460a-adaa-374e725bd860","resolution":{"observed_at":"2026-08-05T14:32:55.957540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09811","last_updated":"2026-06-08T17:55:18Z","snapshot_observed_at":"2026-08-08T02:06:27.713791Z","submitted_at":"2026-06-08T17:55:18Z","title":"AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing","version":1},"cited_work":{"arxiv_id":"2606.09811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09811","snapshot_observed_at":"2026-08-05T14:33:02.506091Z","title":"AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing","venue":"cs.RO","work_id":"ee8c90eb-2671-48da-90d2-ad71bade1d02","year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.017774Z"},"links":{"cited_paper":"/paper/2606.09811","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:7713b147ede388dbb80542625cd48b0402891dafc9eca88fe768ebfa8e689bbe","observation_id":"ee82dfca-f525-4ddc-8502-25823ce74f35","resolution":{"observed_at":"2026-08-05T14:33:02.570822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-08-05T14:32:56.118567Z","title":"World action models: The next frontier in embodied ai.arXiv preprint arXiv:2605.12090, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.118567Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:056e6a22609fb11daa00575c2b84fd36067f048bde5d718a1b116f2e4b15380c","observation_id":"aafc3a52-a6d2-4bba-9431-6e76bc48dc4c","resolution":{"observed_at":"2026-08-05T14:32:56.118567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-08-05T14:32:56.216350Z","title":"Imagewam: Do world action models really need video generation, or just image editing?arXiv preprint arXiv:2606.19531, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.216350Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:d38b4bbb291c1f374c889125af1f01e5d208517e2eae703f5ac04ef8197cac94","observation_id":"edd2fef7-b7a5-4217-b62b-c4a2f1b15af5","resolution":{"observed_at":"2026-08-05T14:32:56.216350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-05T14:32:56.296925Z","title":"pi0.7: a steerable generalist robotic foundation model with emergent capabilities.arXiv preprint arXiv:2604.15483, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.296925Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:cdbe96957867accdba09bc28e98e60b1b16a2510331167e81ef130fb53174fd2","observation_id":"a169bc19-149c-410c-8a59-274aed69d5d5","resolution":{"observed_at":"2026-08-05T14:32:56.296925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-05T14:32:56.361605Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.361605Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:c4444bd32bf0534b98d388d05bec09a1813d0dc574158c569ffd391c8788c5ad","observation_id":"7828e8d5-dadd-443a-bcf1-c16b2f06e388","resolution":{"observed_at":"2026-08-05T14:32:56.361605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-05T14:32:56.601564Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.601564Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:8c6fe9c6b317893b37f5ea2a00da8df2094958104dcc91c727ea74499573c256","observation_id":"5cb9fc7f-edc6-4e18-9ae6-14988e1f9a46","resolution":{"observed_at":"2026-08-05T14:32:56.601564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-05T14:32:56.641912Z","title":"Fast-wam: Do world action models need test-time future imagination?arXiv preprint arXiv:2603.16666, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.641912Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:74bb7e2889636086847570d6e52f94e4e192c8ba9735243c4fab07455e5737b6","observation_id":"58130c7b-c924-44a4-aaaa-a3d1a6cf0842","resolution":{"observed_at":"2026-08-05T14:32:56.641912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:33:03.668653Z","title":"Latent action pretraining from videos","venue":null,"work_id":"2be7f527-6b7a-4eb0-b10e-27f675a6f1a8","year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.715626Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:60bed0bf8ceafff79f6ee35353eb75bca9f811d73efe33211887f93c1f9dce45","observation_id":"c332eef8-cecb-424d-ad69-ec11d291cf6a","resolution":{"observed_at":"2026-08-05T14:33:03.718915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15659","snapshot_observed_at":"2026-08-05T14:32:56.773053Z","title":"Flare: Robot learning with implicit world modeling.arXiv preprint arXiv:2505.15659, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.773053Z"},"links":{"cited_paper":"/paper/2505.15659","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:a55e4ec1d3d393c65cd3019c2e2a8cd19bdcd057f6c8620ab998dbec5fc7ddd3","observation_id":"2d3fc261-e5b5-4257-927a-fd888cc54734","resolution":{"observed_at":"2026-08-05T14:32:56.773053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:56.862393Z","title":"Frappe: Infusing world modeling into generalist policies via multiple future representation alignment.arXiv preprint arXiv:2602.17259, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.862393Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:a03cf2162099b6bdf26f8ff4670318506b09c4a647d35ca676037160a0efa081","observation_id":"30c78cf6-eba0-4709-bca0-ae8cb4e258ac","resolution":{"observed_at":"2026-08-05T14:32:56.862393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:56.953805Z","title":"World guidance: World modeling in condition space for action generation.arXiv preprint arXiv:2602.22010, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.953805Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:27aa58dc9c7440361916b090dc1b414dd4738763f29a8375c337e25e850a75fe","observation_id":"19dbeada-68d4-4e30-ac40-5994ed0d8a73","resolution":{"observed_at":"2026-08-05T14:32:56.953805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00078","snapshot_observed_at":"2026-08-05T14:32:57.031246Z","title":"Being-h0.7: A latent world-action model from egocentric videos.arXiv preprint arXiv:2605.00078, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.031246Z"},"links":{"cited_paper":"/paper/2605.00078","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:6138e7f605aca34f478d035f0b36e7cf2b7ed5c82fe55bb97e7a56c946e48aaa","observation_id":"dd32d228-7c78-442b-9761-087f79551139","resolution":{"observed_at":"2026-08-05T14:32:57.031246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T14:32:57.097363Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.097363Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:4cf37bb3f8fcae169f68132e5628b6f0343602a1cbf7f02c85629951ba36fe38","observation_id":"f2774d46-74ba-4c3b-bc36-9a5c91329a1d","resolution":{"observed_at":"2026-08-05T14:32:57.097363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T14:32:57.160817Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.160817Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:8cab16ddccc89407e31e1938f6f2226f3d4b25c94420276d6c98693945c4c184","observation_id":"e849d66e-e357-44f4-b078-7709ebdc1f56","resolution":{"observed_at":"2026-08-05T14:32:57.160817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T14:32:57.256335Z","title":"pi0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.256335Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:5a93388489b936add9b70cd2b552f8eacb100a92a6dc695af5d53e177492c97d","observation_id":"cbb41822-a14b-40b6-a793-0c1deffb88b2","resolution":{"observed_at":"2026-08-05T14:32:57.256335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:33:03.504117Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, (10-11):1684–1704, 2025","venue":null,"work_id":"edd7cca8-4492-4e80-a4de-98131b07f3d9","year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.351956Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:647120e4c0ecf30d8f84272be862d62dfff63c214d1eb50ec4722781c62f9044","observation_id":"61ba7164-77a8-4297-83a4-98bc09b69429","resolution":{"observed_at":"2026-08-05T14:33:03.593359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T14:32:57.437805Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation.arXiv preprint arXiv:2410.07864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.437805Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:171a7cbd848fd9004e1be8327b1e06684cf6e5de8c8813a44c4184eb6d2d11ad","observation_id":"d28aa5cc-4a46-4529-bced-157f7ae60c69","resolution":{"observed_at":"2026-08-05T14:32:57.437805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-05T14:32:57.513781Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.513781Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:6568d2990af992b0817f5cdae7d2136fc6bb3f912b8ac0dbb3a744a7b55bb399","observation_id":"09db63f0-baad-4dc0-acbe-c5c1b8b84678","resolution":{"observed_at":"2026-08-05T14:32:57.513781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:57.582664Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.582664Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:786e25a6730be4ff1d739b265ca407d44f45921b3ddd731b6ee80a946d728520","observation_id":"4b3b6153-e262-46a5-86b0-71c4d29eb4a5","resolution":{"observed_at":"2026-08-05T14:32:57.582664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-05T14:32:57.632178Z","title":"Smolvla: A vision-language-action model for affordable and efficient robotics.arXiv preprint arXiv:2506.01844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.632178Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:c0f5e461cef2e4f7e810a0fa274413094c0ca69f204f087cf34eab07843b6598","observation_id":"624b610e-cdad-46d5-9bb8-26f1b8afe55d","resolution":{"observed_at":"2026-08-05T14:32:57.632178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:33:03.293138Z","title":"Evo-1: Lightweight vision-language-action model with preserved semantic alignment","venue":null,"work_id":"908874eb-7c18-489e-b914-3b344b8e0983","year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.725468Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:c415a06281ef57a9a5caf8defaed5a1a04185f35dee79259c82570e7a1a2abd5","observation_id":"513b6d52-c676-48e5-8a41-cb28bdc4f371","resolution":{"observed_at":"2026-08-05T14:33:03.361093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-08-05T14:32:57.830889Z","title":"mimic-video: Video-action models for generalizable robot control beyond vlas.arXiv preprint arXiv:2512.15692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.830889Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:70fac2c136a4c9b0887c59b339a0af6ef4b30af2ed6a674d2e4cbdfcf0a77a22","observation_id":"204d50a4-3f8d-43d8-a073-64fcb0dd8a2a","resolution":{"observed_at":"2026-08-05T14:32:57.830889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12898","last_updated":"2025-12-20T02:16:12Z","snapshot_observed_at":"2026-07-30T09:36:32.113048Z","submitted_at":"2025-07-17T08:31:55Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12898","snapshot_observed_at":"2026-08-05T14:32:57.904783Z","title":"Vidar: Embodied video diffusion model for generalist manipulation.arXiv preprint arXiv:2507.12898, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.904783Z"},"links":{"cited_paper":"/paper/2507.12898","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:d7eb61da0eee894b1d8bb57dffce4795ff97a89c94ef9d8b45c83b19681b238f","observation_id":"80ded875-e944-405c-a18b-3ce56ff485a2","resolution":{"observed_at":"2026-08-05T14:32:57.904783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T14:32:57.968368Z","title":"Genie envisioner: A unified world foundation platform for robotic manipulation.arXiv preprint arXiv:2508.05635, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:57.968368Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:aaef3f82fcfeacde5e9aed68231430b73874b9b06884950e2ba72b74b87027e0","observation_id":"a8cd04f0-5c28-417b-b564-9408ac718d31","resolution":{"observed_at":"2026-08-05T14:32:57.968368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-07T12:15:14.265779Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-05T14:32:58.017618Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.017618Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:6569d60f00a3d8f8b25f6d31fb3f2a3ef0c0483bd001da402f2e4face960c931","observation_id":"04db4b54-ea5b-44c0-a632-bf92cc8c6905","resolution":{"observed_at":"2026-08-05T14:32:58.017618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-05T14:32:58.095607Z","title":"Unified video action model.arXiv preprint arXiv:2503.00200, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.095607Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:1c1dd58c3769a2278c4b9d358c9475a3ca7a0dad5cb946b0cd707f25afc9c423","observation_id":"177ff791-ad0d-4bcf-94f2-0600b6fdc66f","resolution":{"observed_at":"2026-08-05T14:32:58.095607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-08-05T14:32:58.180825Z","title":"Motus: A unified latent action world model.arXiv preprint arXiv:2512.13030, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.180825Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:669a725ca4d335016e24049252e406ad68dbc6e67ecb4209e40093b3caedaffe","observation_id":"0eead08b-044d-4b10-a0f3-60123280745e","resolution":{"observed_at":"2026-08-05T14:32:58.180825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:58.231384Z","title":"Gigaworld-policy: An efficient action-centered world–action model.arXiv preprint arXiv:2603.17240, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.231384Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:c78b6779bbde0b3b24fea713aa303bb2a3874efef3d088bf961279e39e62aac4","observation_id":"9c3b8267-03a3-4f67-ba54-0a5920afb5fd","resolution":{"observed_at":"2026-08-05T14:32:58.231384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T14:32:58.324160Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.324160Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:911b4c52309267417a446f2df7f1c442f542d9371ea5476aac9fe336216e2d60","observation_id":"835e31b3-499c-4233-8dc1-2ed73532f4aa","resolution":{"observed_at":"2026-08-05T14:32:58.324160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:58.389393Z","title":"Lawam: Latent world action models for efficient dynamics-aware robot policies.arXiv preprint arXiv:2606.15768, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.389393Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:844688b34a3ff842677e4c6ac500db91f223b276408af625c97789aabdc1bcf2","observation_id":"aaa2c375-cf4e-4af2-9f02-bbe1e023d7b9","resolution":{"observed_at":"2026-08-05T14:32:58.389393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:58.446936Z","title":"Act2goal: From world model to general goal-conditioned policy.arXiv preprint arXiv:2512.23541, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.446936Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:ac93509056d8950b01dd821ba4fd12b91cd02732a19c647b3ce6c4f27c92d17c","observation_id":"bec4487a-27f1-4d51-a5ab-8ba5ee31d14c","resolution":{"observed_at":"2026-08-05T14:32:58.446936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:58.492229Z","title":"Goal-vla: Image-generative vlms as object-centric world models empowering zero-shot robot manipulation.arXiv preprint arXiv:2506.23919, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.492229Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:5f3e70fac03a00c30a06b32fa03b42f30c926ded6051c336860812ffa88c566e","observation_id":"9b45a27c-882f-4f7f-9b04-880887d30029","resolution":{"observed_at":"2026-08-05T14:32:58.492229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-08T03:06:57.057853Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09268","snapshot_observed_at":"2026-08-05T14:32:58.543303Z","title":"Gevrm: Goal-expressive video generation model for robust visual manipulation.arXiv preprint arXiv:2502.09268, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.543303Z"},"links":{"cited_paper":"/paper/2502.09268","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:512b55916a9673d1cdf0dcd5627a7c1d8452cbb909313baa19c4b20590651dfe","observation_id":"8a465ad2-d513-480b-ab07-c2d1cc5d1253","resolution":{"observed_at":"2026-08-05T14:32:58.543303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:33:03.169223Z","title":"Rt-sketch: Goal-conditioned imitation learning from hand-drawn sketches","venue":null,"work_id":"b571afbb-5820-4511-a460-1b3bdb5d9d31","year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.615462Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:37caf4f7342366e49c6b56f4bfa5e68cd3ea29775370ccf7a09b5b46c13d72cc","observation_id":"b0798829-8ad7-4575-810d-b401d33e0dfd","resolution":{"observed_at":"2026-08-05T14:33:03.217189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07169","last_updated":"2025-02-11T17:59:49Z","snapshot_observed_at":"2026-07-06T19:30:39.426499Z","submitted_at":"2024-10-09T17:59:06Z","title":"VIP: Vision Instructed Pre-training for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07169","snapshot_observed_at":"2026-08-05T14:32:58.684511Z","title":"Vip: Vision instructed pre-training for robotic manipulation.arXiv preprint arXiv:2410.07169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.684511Z"},"links":{"cited_paper":"/paper/2410.07169","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:a83550cc2fe1ef8be1412b80e07f958829d2af8d416fa01335ec71ff2b141650","observation_id":"b178cc91-7b65-4209-8b24-7f0c0da83711","resolution":{"observed_at":"2026-08-05T14:32:58.684511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:58.744857Z","title":"Interleave-vla: Enhancing robot manipulation with interleaved image-text instructions.arXiv preprint arXiv:2505.02152, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.744857Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:6d830882b3e5c29bd1a0462d02b3c1443a8a36578610bb7268f6c616a9ba1834","observation_id":"68232906-8a5f-4f40-a680-60c4933fb7e9","resolution":{"observed_at":"2026-08-05T14:32:58.744857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T14:32:58.825010Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.825010Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:36b561f9c68ede2be3bffe41584d101e79997458c8b4cf1769957080057f9667","observation_id":"e4cbc251-a062-4806-8f99-857663118034","resolution":{"observed_at":"2026-08-05T14:32:58.825010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T14:32:58.926973Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.926973Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:63aafcbbae3beaee76cae3f54bbf9f690b1cbd58a756975ecbf3af57d5d6a2a6","observation_id":"2c357bde-41a7-460b-a06f-c20deb37e312","resolution":{"observed_at":"2026-08-05T14:32:58.926973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-05T14:32:58.991193Z","title":"Dinov3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:58.991193Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:8a6619e1345744c3b6d1f5b07c8036b748684a625f6efb582f8c3f75c5a81b92","observation_id":"fb1d462b-f9f6-4689-a1e5-2057056be215","resolution":{"observed_at":"2026-08-05T14:32:58.991193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:59.094177Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.094177Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:5c598b5e9c1c905ac61ac5fe167875fe28721bf26b39842e2df787156c13a067","observation_id":"81ceadc8-b5cd-4f8f-a0cf-72213d2b96cf","resolution":{"observed_at":"2026-08-05T14:32:59.094177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:32:59.186271Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.186271Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:547580c9cb5d43adbfe7d773c4ee7bf7be57385d72acdaa9b7400360fc0edba6","observation_id":"9a5aaf77-867a-45b1-8976-9e018a91910d","resolution":{"observed_at":"2026-08-05T14:32:59.186271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.08534","last_updated":"2023-02-13T15:50:22Z","snapshot_observed_at":"2026-08-07T21:44:39.930046Z","submitted_at":"2022-05-17T17:59:11Z","title":"Vision Transformer Adapter for Dense Predictions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.08534","snapshot_observed_at":"2026-08-05T14:32:59.260963Z","title":"Vision transformer adapter for dense predictions.arXiv preprint arXiv:2205.08534, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.260963Z"},"links":{"cited_paper":"/paper/2205.08534","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:ad25fef971757987bd7e9f7ffff108f5a3a9bbd74f4a2a7dc40dd205f6230ffb","observation_id":"7ae84642-e6d8-421c-bdeb-4647fbafa78d","resolution":{"observed_at":"2026-08-05T14:32:59.260963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:33:02.970102Z","title":"Decoupled weight decay regularization.International Conference on Learning Representations, 2019","venue":null,"work_id":"33bb0177-0a6a-43e6-a466-a05c4f7ba30b","year":2019},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.371736Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:cfa844f38df695e01f4d2d1fa554c44cf2826e56e1b6b346d8343b3446acdcc0","observation_id":"49b76290-f58b-4bae-ab1e-5552be1da6e1","resolution":{"observed_at":"2026-08-05T14:33:03.018624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-05T14:32:59.467106Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation.arXiv preprint arXiv:2506.18088, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.467106Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:4928864d748d43c4751e3acfa1a354db77fdeebb74e0c3e26385c57894ee698d","observation_id":"c94f956e-6745-4490-b7ff-733fb91805bc","resolution":{"observed_at":"2026-08-05T14:32:59.467106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:33:02.786097Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, pages 44776–44791, 2023","venue":null,"work_id":"73e4173c-e5ab-4169-8c2d-5a494af04efb","year":2023},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.544292Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:e0552e3c486e402601829435d82194942c8230c9d6b78b4d606ecffae15a5b97","observation_id":"38699943-3d9c-4af7-97d5-5d159d2fa8b5","resolution":{"observed_at":"2026-08-05T14:33:02.855822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-05T14:32:59.617097Z","title":"X-vla: Soft-prompted transformer as scalable cross-embodiment vision-language- action model.arXiv preprint arXiv:2510.10274, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.617097Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:586dee7ffac9ec0cb9592ef50f00b4b9844e96c917f109bfcc8b1ecacbacb5cc","observation_id":"1643af9e-823d-4542-94e4-9d526f29597f","resolution":{"observed_at":"2026-08-05T14:32:59.617097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-08-05T14:32:59.697041Z","title":"Abot-m0: Vla foundation model for robotic manipulation with action manifold learning.arXiv preprint arXiv:2602.11236, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.697041Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:a34ea3b1c67d08a9a6b97a8013a5a10730a95be2e999d2ced1335438abe5607f","observation_id":"4d59531d-a8d7-4832-b961-fefe7b57806d","resolution":{"observed_at":"2026-08-05T14:32:59.697041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T14:32:59.856976Z","title":"π0.5: a Vision-Language-Action Model with Open-World Generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.856976Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:c1c998e1fde3cd674244de8c25cace09c8babe5f067e517c19c46e0fdd5ec61c","observation_id":"6a020134-0fd5-48b6-b43c-21491cf66e40","resolution":{"observed_at":"2026-08-05T14:32:59.856976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-08-05T14:32:59.965947Z","title":"Starvla: A lego-like codebase for vision-language-action model developing.arXiv preprint arXiv:2604.05014, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:59.965947Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:807ea186f229dbbd99ef540312c444e1792367e0129ba8f2f338b4353b1cd607","observation_id":"3a244af1-e451-4774-8a86-73414bee6ba5","resolution":{"observed_at":"2026-08-05T14:32:59.965947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-05T14:33:00.058353Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T14:33:00.058353Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:d4b52060c3b2b15a52596ebe093b76c96201709b83b75a8fd47e0d000a877c47","observation_id":"904b5a79-ed15-4ccd-9790-1ac344901ee1","resolution":{"observed_at":"2026-08-05T14:33:00.058353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T14:33:00.157562Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T14:33:00.157562Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:3e381de312f056781fb4e7ad2c351a72f3f49b5a09fbbc332334da51b3310147","observation_id":"a7e9ce28-e83a-4c59-be4d-f51c618a6ffa","resolution":{"observed_at":"2026-08-05T14:33:00.157562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:33:00.314367Z","title":"Jepa-vla: Video predictive embedding is needed for vla models.arXiv preprint arXiv:2602.11832, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T14:33:00.314367Z"},"links":{"citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:edda78879a7b9d280bb939c037fb70f7290436703b303b439d075bfe5e96c29d","observation_id":"e496b5fe-93fe-4f35-a4f2-7925173dba14","resolution":{"observed_at":"2026-08-05T14:33:00.314367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T03:53:57.854558Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.03701."}