{"as_of":"2026-08-23T05:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0eea5e1ed7f157df3394bbc39a28c741836763a21955abdfc02ab7bbb696bcfe","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:40:07.375891Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05706/citation-record","integrity":"/paper/2608.05706/integrity","json":"/paper/2608.05706/citation-record.json","paper":"/paper/2608.05706"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-15T14:40:07.152351Z","title":"arXiv preprint arXiv:2602.06949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.152351Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:07bda408c10e6a0074a3f471ea9fb5d1f947e221e0008bba017f8a4a2f3fac5e","observation_id":"7a56acd0-c70f-47bb-ae08-422e8882c6c8","resolution":{"observed_at":"2026-08-15T14:40:07.152351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-18T07:04:58.690133Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-15T14:40:07.159635Z","title":"arXiv preprint arXiv:1803.10122 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.159635Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:b84fdc6d635edba569b44a6d6143bdcf804524e4ea1e234ca1c77cccc65168a1","observation_id":"1873b4fa-ba5c-4783-b5cf-339d68e3f0d0","resolution":{"observed_at":"2026-08-15T14:40:07.159635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.164641Z","title":"arXiv preprint arXiv:2602.08971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.164641Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:73e7bafc1fed471c0a9a6e20101dbe06f9097968884a333c3f8e93f4704eadbb","observation_id":"50b8581c-fd22-468e-877a-fc31cb26f6c9","resolution":{"observed_at":"2026-08-15T14:40:07.164641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.452103Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":"4cab8f82-6a3d-48b0-88ab-f149359144e7","year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.169486Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:cc5c9d5febecb1573c3b226f198742468a7597e8ef028c54a46c520a0d2dd874","observation_id":"d0b0ef2f-68ee-4e41-948d-6d518f5e0ecd","resolution":{"observed_at":"2026-08-15T14:40:08.456625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.174240Z","title":"arXiv preprint arXiv:2509.18428 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.174240Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:98c333ebc41419db8c571ac8d9733fa8abf570d12a2c657c8bfdb759cfe3e6c6","observation_id":"3a559900-1051-4b97-9013-06061f1e2e13","resolution":{"observed_at":"2026-08-15T14:40:07.174240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.436369Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":"acf256bf-c95e-4b48-91be-82cb5c44e0ab","year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.178944Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:2047129bef7241d09f127867136e68068e93ba87717abbbda8400b24f9bec989","observation_id":"bf69446b-ac5c-4e56-8d52-e0f7a82de674","resolution":{"observed_at":"2026-08-15T14:40:08.441230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.184105Z","title":"ACM Computing Surveys , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.184105Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:a58a1ab1fba1066c1c8080bfcacb76393f40df6009435e9fc22456b91c1c71a6","observation_id":"c28573d1-296a-4b6c-8236-ef72efc019d1","resolution":{"observed_at":"2026-08-15T14:40:07.184105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.188665Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.188665Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:0ae59c9ef7906ab463a5ea616693c82027e0dc8fc841418148d17fca34c8de2c","observation_id":"77394885-0bae-41a1-a508-68ba728728ad","resolution":{"observed_at":"2026-08-15T14:40:07.188665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11709","last_updated":"2026-03-09T06:44:42Z","snapshot_observed_at":"2026-08-12T03:35:51.024147Z","submitted_at":"2025-05-16T21:34:47Z","title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11709","snapshot_observed_at":"2026-08-15T14:40:07.193194Z","title":"arXiv preprint arXiv:2505.11709 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.193194Z"},"links":{"cited_paper":"/paper/2505.11709","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:5cd98aeb799c49f297b9c0b9bcb834d9ba5513d5aada377503755c3bfc10ffc5","observation_id":"187c6554-d761-4125-88e4-fb9e725207f1","resolution":{"observed_at":"2026-08-15T14:40:07.193194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.401968Z","title":"Proceedings of the IEEE international conference on computer vision workshops , pages=","venue":null,"work_id":"c7b19f4d-d933-41d0-be99-acf72074196f","year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.198170Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:7bbf5c6dff40967bfd21e52c495d9ba3a9798013cbcaeae25305826bdea7c768","observation_id":"0bec954a-934b-41f0-a34a-2f19cc53ad23","resolution":{"observed_at":"2026-08-15T14:40:08.406802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.386238Z","title":"Information , volume=","venue":null,"work_id":"090b2bb3-dcbd-4040-bbb5-0ce528402480","year":2025},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.202709Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:9ef76806692d3850cd39e16cbe58397fa9ae0b435672cda9f69d0708ac18e680","observation_id":"9092ceff-b31b-4ce3-80bb-51c525aab05a","resolution":{"observed_at":"2026-08-15T14:40:08.391061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.370951Z","title":"IEEE Transactions on Circuits and Systems for Video Technology , year=","venue":null,"work_id":"7babd49f-a595-474e-8f0d-2b471592a45c","year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.207568Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:e629ae6f46e25ca919f3b8abd4830bd7c86b3d79555063cce2a3020b58f1a159","observation_id":"5f32f908-cadc-4bc9-95e9-f198ec869673","resolution":{"observed_at":"2026-08-15T14:40:08.376033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.212364Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.212364Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:251de6618b21aa8c070af44dc846c4d18880fa8bd9ca39f817690ae884df23b4","observation_id":"af92a951-88ff-4246-b29b-9163eed2748f","resolution":{"observed_at":"2026-08-15T14:40:07.212364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17006","last_updated":"2026-06-18T14:11:48Z","snapshot_observed_at":"2026-08-17T02:45:32.274237Z","submitted_at":"2025-05-22T17:58:27Z","title":"CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17006","snapshot_observed_at":"2026-08-15T14:40:07.217008Z","title":"arXiv preprint arXiv:2505.17006 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.217008Z"},"links":{"cited_paper":"/paper/2505.17006","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:952e245a71c8bed968eb44229824e617f9d4879ab4ffe9334ad83dd4e2711724","observation_id":"5bb810fe-cbbc-429a-ac42-43a959ec9f27","resolution":{"observed_at":"2026-08-15T14:40:07.217008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20231","last_updated":"2026-04-09T04:26:01Z","snapshot_observed_at":"2026-08-15T02:14:17.838458Z","submitted_at":"2026-02-23T18:41:41Z","title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.20231","snapshot_observed_at":"2026-08-15T14:40:07.222127Z","title":"arXiv preprint arXiv:2602.20231 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.222127Z"},"links":{"cited_paper":"/paper/2602.20231","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:52e767356f9f52dddf4e23f39a3f497bba9a38e6fcd1bbfd7b42e7d6b45d1d46","observation_id":"bd589732-b984-4ad1-9358-beefad358c8c","resolution":{"observed_at":"2026-08-15T14:40:07.222127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03668","last_updated":"2026-05-27T09:21:04Z","snapshot_observed_at":"2026-08-15T04:15:25.091603Z","submitted_at":"2026-02-03T15:51:25Z","title":"MVP-LAM: Learning Action-Centric Latent Action via Cross-Viewpoint Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.03668","snapshot_observed_at":"2026-08-15T14:40:07.227067Z","title":"arXiv preprint arXiv:2602.03668 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.227067Z"},"links":{"cited_paper":"/paper/2602.03668","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:6213ce2ab218c9ef7cc4d5f04ec1ffe46f6553ebb63030f399d3fa2c0346015c","observation_id":"4782b40d-a2f1-4d17-bc40-60d69d2fc14b","resolution":{"observed_at":"2026-08-15T14:40:07.227067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08086","last_updated":"2025-08-11T15:29:57Z","snapshot_observed_at":"2026-08-10T14:26:28.305874Z","submitted_at":"2025-08-11T15:29:57Z","title":"Matrix-3D: Omnidirectional Explorable 3D World Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08086","snapshot_observed_at":"2026-08-15T14:40:07.232129Z","title":"arXiv preprint arXiv:2508.08086 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.232129Z"},"links":{"cited_paper":"/paper/2508.08086","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:715dd246f85bdfde14fdc9f4f760dcdeabd51ffaf9b19f9154fb802a83acd1a0","observation_id":"58339da7-bf62-4506-9e74-d0e84e2127ca","resolution":{"observed_at":"2026-08-15T14:40:07.232129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.237245Z","title":"arXiv preprint arXiv:2603.02049 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.237245Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:061b8aeb97c78adec05e14922b1371f9d5c2729b579bde5b426c4126f560f935","observation_id":"79632db0-bc30-4d79-a1cb-09400bddebe1","resolution":{"observed_at":"2026-08-15T14:40:07.237245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.345874Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":"eb5f54cb-302c-4ba3-b7f2-bc891fc9b206","year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.241821Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:62357a7283b3051ffc1d01d72330ef464b479d7a05b7304fe1e4396e63606066","observation_id":"3fa8eaa9-ee2d-4a5a-a537-63d132a80dd5","resolution":{"observed_at":"2026-08-15T14:40:08.350609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.330195Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":"f48ca726-39bb-443d-9371-9e8832aaa471","year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.246395Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:268d5db4e3d3e018dd725bb487e7651b508693b3d2868c089d7fe8a887b8bbbf","observation_id":"2b46a3d8-c219-4fcf-a7ab-a4414bd46aa5","resolution":{"observed_at":"2026-08-15T14:40:08.335220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-19T20:36:18.684533Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-08-15T14:40:07.251146Z","title":"arXiv preprint arXiv:2504.20995 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.251146Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:f31ab4f1203213540d26b3698867b6f26c72bcb77a04408579c59a1313131f28","observation_id":"b01bfe53-e14b-4e16-ab3a-af75e57f8b4b","resolution":{"observed_at":"2026-08-15T14:40:07.251146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.256196Z","title":"arXiv preprint arXiv:2603.16669 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.256196Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:4e17c43d3c1117a568d3dc695197f8ca1b0116b26b4dcb41a523fc0959e2a0bf","observation_id":"cd7cdac9-e99f-4b6c-8212-327d28a976f9","resolution":{"observed_at":"2026-08-15T14:40:07.256196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.260571Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.260571Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:ac6384dbdaa0077a648f10bbf5a007daab1f92bffd2b9293f9368662ecc63184","observation_id":"a5b04d29-8c5e-4184-9fe1-bb085d3e6bbd","resolution":{"observed_at":"2026-08-15T14:40:07.260571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-15T14:40:07.265393Z","title":"arXiv preprint arXiv:1312.6114 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.265393Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:0da9ee0c9ae7dc5ccabba0b8182cd50dcfafbc073ae32e04a9910ddc6994af53","observation_id":"68f96fed-7a86-49e6-80d2-b4a7669605cc","resolution":{"observed_at":"2026-08-15T14:40:07.265393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.270368Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.270368Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:6f937eca505148e896ed8e809d355cadf5bbf1a9c35fc44a3d816eaf2203a39b","observation_id":"948e2089-3b79-436a-9ff3-fe64529e9a30","resolution":{"observed_at":"2026-08-15T14:40:07.270368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.274848Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.274848Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:c819f505543f9faf378235be4617542923a3ddefb95a8869d541ed4697d57326","observation_id":"df3dff62-bbec-4ba0-849e-8c11eae64aa8","resolution":{"observed_at":"2026-08-15T14:40:07.274848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-15T14:40:07.279295Z","title":"arXiv preprint arXiv:2511.00062 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.279295Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:5b59e83f8449f6f37bd012832dac5dc02f94b45c8e3e52002ac323219421c45a","observation_id":"cec448c4-d215-404d-9331-609c7d817d6e","resolution":{"observed_at":"2026-08-15T14:40:07.279295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.283852Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.283852Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:02bef09becaa328a018c79b23d9667e53eb9cde99f37474772f80f9d0f841e91","observation_id":"bc553a53-fe63-4991-a15b-308937ea2e11","resolution":{"observed_at":"2026-08-15T14:40:07.283852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T14:40:07.288404Z","title":"arXiv preprint arXiv:1711.05101 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.288404Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:cbadd3d3892d0596d6ab49aab8e9c0e6faa7fb6bd75e5561557b8473934596ed","observation_id":"c21baf44-deda-4355-8299-2e14a0194650","resolution":{"observed_at":"2026-08-15T14:40:07.288404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.276772Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"850cb6c4-ae8a-4a43-a815-dddd9b0b51e0","year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.292847Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:1ccdccd110fc4636c4bd60f91bb1f3e8746e0bc15f16d8b95c53776c7c0fbce5","observation_id":"4fb72cdb-b9b7-46d8-9dff-8f56e8fc3fc6","resolution":{"observed_at":"2026-08-15T14:40:08.281704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.262048Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"bef045dd-d664-444b-8452-bd3fda02b790","year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.297201Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:f402427920a20d37b217b3fec8028681d21e21379238e64777e23e89ae957809","observation_id":"af4c7818-7594-46f5-9a98-6ccfbb010ad8","resolution":{"observed_at":"2026-08-15T14:40:08.266607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-15T14:40:07.301553Z","title":"arXiv preprint arXiv:2503.06669 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.301553Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:0708613ac6feab99050a80329f8d9b304ebdd6e2677ccd590c9206141faf959e","observation_id":"f8f4d78a-1de8-47b5-8ea7-f59f6dd2aac8","resolution":{"observed_at":"2026-08-15T14:40:07.301553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.246607Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":"aceaa30c-7fa6-4a4b-9155-1ea7996b61e4","year":2022},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.306494Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:7e443a218a095c215fdbe0c5e6974291354f1b5ccbc6cc0b42f0b4f364ff219b","observation_id":"e7730794-cf78-4129-a527-4015f64704d5","resolution":{"observed_at":"2026-08-15T14:40:08.251260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T14:40:07.311049Z","title":"arXiv preprint arXiv:2212.06817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.311049Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:9e905655df27595594a3cd7852bfc610a61bd22642fae4f27821974a9f43f6e4","observation_id":"bf04f645-de69-4a4e-acb3-641ba0293a2b","resolution":{"observed_at":"2026-08-15T14:40:07.311049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-15T14:40:07.315803Z","title":"arXiv preprint arXiv:2403.12945 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.315803Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:2e7937a692a3d5f8aee658cf63ce3cbfebb094563a88c16ec69b6b0793d09164","observation_id":"5986c8bc-b66f-4c13-a7b0-40175035f922","resolution":{"observed_at":"2026-08-15T14:40:07.315803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.320452Z","title":"arXiv preprint arXiv:2511.19861 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.320452Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:8cfbd93cb32ea9f62c547a031b5337b3a0f854fc251d40c37e82d93e57241572","observation_id":"954fc41a-4369-4f78-8c4a-272baef71d10","resolution":{"observed_at":"2026-08-15T14:40:07.320452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-15T14:40:07.324833Z","title":"arXiv preprint arXiv:2508.05635 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.324833Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:a5defb3d17c70538b3ad3eb824b566410e643e3550cba47932f2b3dbd461249c","observation_id":"f921e2da-2736-4c72-961b-538339133b91","resolution":{"observed_at":"2026-08-15T14:40:07.324833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.329341Z","title":"arXiv preprint arXiv:2509.22642 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.329341Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:20de2e516b4ec8e0fc4514e69fa42050d8133ef44cc1e3b7a85042ea62506a18","observation_id":"9c52da61-16c5-4926-aa13-dd9c5f9f00f9","resolution":{"observed_at":"2026-08-15T14:40:07.329341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.333883Z","title":"2012 IEEE/RSJ international conference on intelligent robots and systems , pages=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.333883Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:0ac15df5c87337c22e8de491236e446dda1bb1075ac47e4deee5cbcd5c86ca64","observation_id":"9c31b82a-39f2-4453-b959-be4015e718c7","resolution":{"observed_at":"2026-08-15T14:40:07.333883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.338557Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.338557Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:7eba59dfff88463a7ed40fac689750f124f0ec4fe5888c9e0555451dbf471ccc","observation_id":"a301993f-8d65-4d19-8e5b-e53d9c6fb15a","resolution":{"observed_at":"2026-08-15T14:40:07.338557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.343873Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.343873Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:e24012cc7a61534f7e9fff6b5aa34aaf3d8b99979c08a46b101bdc2f341924a6","observation_id":"795d49cb-f277-482b-a054-17dc2059ac85","resolution":{"observed_at":"2026-08-15T14:40:07.343873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.348478Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.348478Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:54481ccfd4c6787e693f5aaf581aef78dbb235992a7ca822a2fd8daafb467c83","observation_id":"650b7bfc-960a-438d-921e-44f8a1ae4592","resolution":{"observed_at":"2026-08-15T14:40:07.348478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T14:40:07.352723Z","title":"arXiv preprint arXiv:2304.07193 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.352723Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:e45df47a4521e76da4592a9da851f545cc95c631e65b5c4094e6a34da579db33","observation_id":"6de7b6e5-fb24-4981-9662-31f681dd6d1c","resolution":{"observed_at":"2026-08-15T14:40:07.352723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-08-09T22:50:03.459615Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-15T14:40:07.357342Z","title":"arXiv preprint arXiv:1610.01644 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.357342Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:2b1acb9b2de88a14adbb59095b22f914da22adb1d7d5743bc6339e0c316e660c","observation_id":"944a9886-f34e-4779-ad8d-76d1f757f4c9","resolution":{"observed_at":"2026-08-15T14:40:07.357342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.362189Z","title":"Conference on Robot Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.362189Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:cb6fefbc6ecc93658a7171c58e8e9d20777043e127abb0321dc110beade2ba98","observation_id":"50041f86-c19e-4770-9a61-4d4e73e6add0","resolution":{"observed_at":"2026-08-15T14:40:07.362189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:08.178336Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"12aa8ba3-b312-4c61-804b-7eed3b29605e","year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.367081Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:256a604834f5bef7c576c2e6474f8ea59e3aec9da1b6eba09ec384ff2f1dc393","observation_id":"8b710d7a-de06-46ac-8e35-0782e632c794","resolution":{"observed_at":"2026-08-15T14:40:08.184466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.371564Z","title":"arXiv preprint arXiv:2506.01943 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.371564Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:1c979b44010e62caf92cd0049c0c428b651572be8e9c9b7be1a65f8a6669c834","observation_id":"9650b37b-1d93-4d37-8cfa-289946d74339","resolution":{"observed_at":"2026-08-15T14:40:07.371564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:40:07.375891Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:40:07.375891Z"},"links":{"citing_paper":"/paper/2608.05706"},"observation_digest":"sha256:14f2e454bcd95c1fd57b71559a4ae8264632f287949acf4f87ef8904c7385d72","observation_id":"a010eef1-e2ab-4ec2-a469-ec08cf18f0b6","resolution":{"observed_at":"2026-08-15T14:40:07.375891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05706","last_updated":"2026-08-06T07:47:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T14:41:54.626348Z","submitted_at":"2026-08-06T07:47:01Z","title":"LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2608.05706."}