{"as_of":"2026-08-13T21:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52e37be5033817f3eb73dd62b90aac23ef26b539b692518303adb556c6452669","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:20:05.857938Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T09:42:44.654825Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T06:29:37.344466Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"cited_work":{"arxiv_id":"2602.10104","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.10104","snapshot_observed_at":"2026-07-04T06:29:37.344466Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","venue":"cs.CV","work_id":"dcacc723-b8e0-4705-9c61-5ae898b7310e","year":2026},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-08-10T04:19:28.721919Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2602.10104","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:88d8a1423ed924e4c660cc2a4cdcc4158d6dda3b49e506bc43e8619e31972d48","observation_id":"03467068-3f90-41c2-aff6-98c5a151d989","resolution":{"observed_at":"2026-07-01T21:06:13.800395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"cited_work":{"arxiv_id":"2602.10104","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.10104","snapshot_observed_at":"2026-07-04T06:29:37.344466Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","venue":"cs.CV","work_id":"dcacc723-b8e0-4705-9c61-5ae898b7310e","year":2026},"citing_paper":{"arxiv_id":"2606.21139","last_updated":"2026-06-19T06:24:05Z","snapshot_observed_at":"2026-08-08T10:51:24.514991Z","submitted_at":"2026-06-19T06:24:05Z","title":"PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:28:36.505775Z"},"links":{"cited_paper":"/paper/2602.10104","citing_paper":"/paper/2606.21139"},"observation_digest":"sha256:b158f7ae694634ea65d6efd3ebc6cd23d48c46d1c2e6b8375598972d2cd280cf","observation_id":"842a877a-17df-434d-9764-b3b4928071fd","resolution":{"observed_at":"2026-07-04T06:29:37.345884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.10104","snapshot_observed_at":"2026-07-31T09:42:44.654825Z","title":"Tsang, and Mike Zheng Shou","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28362","last_updated":"2026-07-30T15:28:43Z","snapshot_observed_at":"2026-08-13T19:01:05.315969Z","submitted_at":"2026-07-30T15:28:43Z","title":"ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T09:42:44.654825Z"},"links":{"cited_paper":"/paper/2602.10104","citing_paper":"/paper/2607.28362"},"observation_digest":"sha256:5a9e07131a88ce19c2214fb0868301eae891bd41bac93084dd3d040e1d9622d3","observation_id":"6bb3bf1a-7a45-4fdc-aaef-54f4d41d3218","resolution":{"observed_at":"2026-07-31T09:42:44.654825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.10104/citation-record","integrity":"/paper/2602.10104/integrity","json":"/paper/2602.10104/citation-record.json","paper":"/paper/2602.10104"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-03T01:20:04.586979Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.586979Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:6d65179549dba502442e01537c40a3034ef70ed43e588e8c7f3883a76fbe6de1","observation_id":"52071e9b-e375-4f87-96a4-3c7465b46f9b","resolution":{"observed_at":"2026-08-03T01:20:04.586979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-08-03T01:20:04.689537Z","title":"Mo- tus: A unified latent action world model.arXiv preprint arXiv:2512.13030,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.689537Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:f3e94c5535ed9fcafb95faa6c1d2e0ea963322b1b042be15d047c09bdf9a6adf","observation_id":"43ef84fc-5994-4ce2-bc01-e72497136123","resolution":{"observed_at":"2026-08-03T01:20:04.689537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-03T01:20:04.726504Z","title":"UniVLA: Learning to act anywhere with task- centric latent actions.arXiv preprint arXiv:2505.06111,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.726504Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:d426ae2fa39ee85de4a0a77719a2b0060529692f83760f3babde4904492cccfc","observation_id":"13b2f4b7-e832-4f2e-94d7-7ab0a2411131","resolution":{"observed_at":"2026-08-03T01:20:04.726504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-13T21:01:04.724772Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-03T01:20:04.762038Z","title":"Video- JAM: Joint appearance-motion representations for en- hanced motion generation in video models.arXiv preprint arXiv:2502.02492,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.762038Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:df44ae64c5da9bd54f110118be3535cbf958681f0f45be27b1ca32bbe72469cb","observation_id":"a5237902-803f-4c63-88f0-1a1ce5e7505b","resolution":{"observed_at":"2026-08-03T01:20:04.762038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-03T01:20:04.797838Z","title":"SkyReels-V2: Infinite-length film generative model.arXiv preprint arXiv:2504.13074, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.797838Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:483efe413465661481ccebdf887c51a7f9af5cac18f15c43a4df0c801a0a120d","observation_id":"5a9966e7-249e-4536-8d2d-1ce8cd88630d","resolution":{"observed_at":"2026-08-03T01:20:04.797838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-09T02:36:54.979612Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-03T01:20:04.834334Z","title":"AdaWorld: Learning adaptable world models with latent actions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.834334Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:6ea85afd98020ea602a9b661c963e2d473bb8c62f5076103e11a5e10c9bedff6","observation_id":"da343538-6d13-4a19-9490-fb0384b84915","resolution":{"observed_at":"2026-08-03T01:20:04.834334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:04.868697Z","title":"Learning latent action world models in the wild.arXiv preprint arXiv:2601.05230,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.868697Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:32b2ecc773be42b5b2c72978689cf1df875b4c739ee121c6a5534ed850b34cc6","observation_id":"a802e553-33bd-4666-b674-f5116de657b6","resolution":{"observed_at":"2026-08-03T01:20:04.868697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-03T01:20:04.942278Z","title":"and Schmidhuber, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.942278Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:d583415f80adb9122e2bc4bb146bbd4b82d0ee589b5e1df6440d42e105a7c89d","observation_id":"33a510f0-6f5f-46c0-918d-3eeca10bd830","resolution":{"observed_at":"2026-08-03T01:20:04.942278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-07-06T22:13:09.586800Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10934","snapshot_observed_at":"2026-08-03T01:20:05.068180Z","title":"Generating long- take videos via effective keyframes and guidance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.068180Z"},"links":{"cited_paper":"/paper/2508.10934","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:9831d64cd6ed22b6325367ec73a6ae2135647ff285b4d528c3e19853e3a1ff5f","observation_id":"736ddd35-5f3e-4def-83fe-e5cc57226648","resolution":{"observed_at":"2026-08-03T01:20:05.068180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05094","last_updated":"2026-05-21T08:23:12Z","snapshot_observed_at":"2026-08-01T23:38:17.815297Z","submitted_at":"2025-10-06T17:57:59Z","title":"VChain: Chain-of-Visual-Thought for Reasoning in Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05094","snapshot_observed_at":"2026-08-03T01:20:05.104048Z","title":"VChain: Chain-of-visual-thought for reasoning in video generation.arXiv preprint arXiv:2510.05094, 2025d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.104048Z"},"links":{"cited_paper":"/paper/2510.05094","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:c69115f6eda05f20d374091b4f2f8b0d27d3e78e87225aaa0b8b5b8a0c88215d","observation_id":"faeefcb4-f2c9-4913-89e2-b32bc9491dbe","resolution":{"observed_at":"2026-08-03T01:20:05.104048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T01:20:05.160714Z","title":"HunyuanVideo: A systematic framework for large video generative mod- els.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.160714Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:6d2201de34fe3c36ef80c2e3c9d500189c17f7119c71b78354f055dccf5634d1","observation_id":"309db6c4-7de5-4cf6-b322-d0672ef371fb","resolution":{"observed_at":"2026-08-03T01:20:05.160714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.187392Z","title":"What about gravity in video generation? post-training newton’s laws with verifiable rewards.arXiv preprint arXiv:2512.00425,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.187392Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:86780c3647eb1e0bfb3c6d07e9f70c3318c20f17d0e442a6098bc43f919d7176","observation_id":"58588272-fc98-4b23-9a36-892eaf3e12b0","resolution":{"observed_at":"2026-08-03T01:20:05.187392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.220090Z","title":"REPA-E: Unlocking vae for end-to-end tuning with latent diffusion transformers.arXiv preprint arXiv:2504.10483,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.220090Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:77efa5bb7ada99d2a07238a449bbc46b85e9bcc14a7e5e75dda7b59f092366b2","observation_id":"d84a29e6-874c-4c8e-99f9-c89210758a77","resolution":{"observed_at":"2026-08-03T01:20:05.220090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19868","last_updated":"2025-02-27T08:21:03Z","snapshot_observed_at":"2026-08-07T17:43:39.369961Z","submitted_at":"2025-02-27T08:21:03Z","title":"C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19868","snapshot_observed_at":"2026-08-03T01:20:05.240723Z","title":"C., Khan, S., Zhu, Y ., Sun, J., Zhang, Y ., and Khan, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.240723Z"},"links":{"cited_paper":"/paper/2502.19868","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:fc31329c5e31ad4fbbc6464390c339f6a2ff7873292752917615a58feee88cd5","observation_id":"42ad66a7-f86c-46ee-97b0-21c9d5390935","resolution":{"observed_at":"2026-08-03T01:20:05.240723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-11T23:38:12.766811Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-03T01:20:05.279081Z","title":"Open-Sora 2.0: Training a commercial-level video generation model in $200 k.arXiv preprint arXiv:2503.09642,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.279081Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:806a92fbfaf1dd61bce78441e1e4834e0e5bfad1994358a185b2b41d33bbc44a","observation_id":"56670dff-207b-4700-a755-4fe2b3d1e2b1","resolution":{"observed_at":"2026-08-03T01:20:05.279081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.315656Z","title":"What matters for representation alignment: Global information or spatial structure?arXiv preprint arXiv:2512.10794,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.315656Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:0f575a9c7e682d42a6d716170999cd6ab0d2bbbfb56653caf8946b7499ba4e93","observation_id":"fb938414-a4d9-4490-a804-b479e94119fc","resolution":{"observed_at":"2026-08-03T01:20:05.315656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-03T16:11:09.055651Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-08-03T01:20:05.343032Z","title":"WorldPlay: to- wards long-term geometric consistency for real-time inter- active world modeling.arXiv preprint arXiv:2512.14614,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.343032Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:c6573ce32725760684f125bf9b33d0aff18965b679fc70a0b15545687bd7fdd0","observation_id":"c233663b-9f45-4410-a8ac-6b02cfc926ab","resolution":{"observed_at":"2026-08-03T01:20:05.343032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.379521Z","title":"Hunyuan-GameCraft- 2: Instruction-following interactive game world model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.379521Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:593c5408fd8f958a783d06a4be44e410adf8e500374e711f9aa3a9df90174a40","observation_id":"a7785d32-b6f0-4c38-b681-7821f6e41bc9","resolution":{"observed_at":"2026-08-03T01:20:05.379521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-13T17:45:09.123419Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-08-03T01:20:05.415787Z","title":"L., Li, Y ., Wang, H., Xu, Y ., Ma, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.415787Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:6cdbfd8cc38473829ef2997bea1422d65127ee4a3e808e4d852b8ef2e537a090","observation_id":"e68baeef-f02d-4719-879c-080c64073f28","resolution":{"observed_at":"2026-08-03T01:20:05.415787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-03T01:20:05.452452Z","title":"MAGI-1: Au- toregressive video generation at scale.arXiv preprint arXiv:2505.13211,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.452452Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:bb01179785f51c038fda0b2758c0d4767d96eb16527bc738d69265e17b070072","observation_id":"879f17e1-9231-44e1-9cd9-6a0bc4927fb0","resolution":{"observed_at":"2026-08-03T01:20:05.452452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T01:20:05.488049Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.488049Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:e27089296bedd46bd5c1a915dd7c400f741871b8f5752eb5b3b27d8e7721d636","observation_id":"dcb3cf1f-16ce-4c59-9c65-562e836051d8","resolution":{"observed_at":"2026-08-03T01:20:05.488049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00537","last_updated":"2023-01-02T06:16:56Z","snapshot_observed_at":"2026-08-13T13:10:58.579767Z","submitted_at":"2023-01-02T06:16:56Z","title":"Posterior Collapse and Latent Variable Non-identifiability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00537","snapshot_observed_at":"2026-08-03T01:20:05.524183Z","title":"M., and Cunningham, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.524183Z"},"links":{"cited_paper":"/paper/2301.00537","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:9aad519a964d3319342de8389d390c36364fcfc267837ca1d59edb2a841373b4","observation_id":"0e07ce05-91b2-40dc-9d2c-b0b1c7801cd2","resolution":{"observed_at":"2026-08-03T01:20:05.524183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26433","last_updated":"2026-04-06T15:21:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T12:28:40Z","title":"Co-Evolving Latent Action World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26433","snapshot_observed_at":"2026-08-03T01:20:05.560810Z","title":"Co-Evolving latent action world models.arXiv preprint arXiv:2510.26433,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.560810Z"},"links":{"cited_paper":"/paper/2510.26433","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:ee7231c6d44d94c16139b459d10ce57e7b8dcef58cd116f2397060961864c5eb","observation_id":"98db06a2-b101-4f05-bdc4-bc0e9f6d82c7","resolution":{"observed_at":"2026-08-03T01:20:05.560810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-03T01:20:05.597563Z","title":"S., Matarese, N., Swer- sky, K., Kim, B., Jaini, P., and Geirhos, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.597563Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:35957a37cf0f0385bc86c5095aa574ef47ab1dbe3a67b0e1e5f7e054e35ade6f","observation_id":"d4271ad1-e621-4140-b318-795f780d4f68","resolution":{"observed_at":"2026-08-03T01:20:05.597563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.633102Z","title":"VideoAuteur: Towards long narrative video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.633102Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:4a653271d1c67e6d56010e0b6969b1f3e7dfa424fd6ec2a909fc824ecfbaf2e4","observation_id":"c6a8283b-4728-41b7-84fa-13ad89c0f4a4","resolution":{"observed_at":"2026-08-03T01:20:05.633102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.668370Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.668370Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:b905a2371ec4723eee2abcdbd551bd9645af66c0b5ad659c92b69877597978bf","observation_id":"fbc78494-4d02-4b2e-afbd-169caaea4faa","resolution":{"observed_at":"2026-08-03T01:20:05.668370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.704141Z","title":"GameFactory: Creating new games with generative inter- active videos.arXiv preprint arXiv:2501.08325, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.704141Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:77109145067a0b80591981a68b41a39f315960bdceee71a3be00542271cf8331","observation_id":"802d0bb7-ad06-4f6c-b8e5-34ab778c7730","resolution":{"observed_at":"2026-08-03T01:20:05.704141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12345","last_updated":"2024-05-31T21:36:57Z","snapshot_observed_at":"2026-08-13T14:38:46.705936Z","submitted_at":"2022-08-25T21:08:01Z","title":"Light-weight probing of unsupervised representations for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12345","snapshot_observed_at":"2026-08-03T01:20:05.740347Z","title":"Light-weight probing of unsupervised repre- sentations for reinforcement learning.arXiv preprint arXiv:2208.12345,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.740347Z"},"links":{"cited_paper":"/paper/2208.12345","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:1a3440780d390968c9490a19966cd5573a33ec43bf43bce94e170440fdc3927e","observation_id":"d5d8b808-8ec5-45c7-9ece-95dc7f9a5a55","resolution":{"observed_at":"2026-08-03T01:20:05.740347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-08-13T15:40:46.887539Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-08-03T01:20:05.776188Z","title":"VideoREPA: Learning physics for video generation through relational alignment with foundation models.arXiv preprint arXiv:2505.23656,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.776188Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:3aa9076b25db76d73e4faa5b5955a07b664dfea2568789e02bb9fb96fe87d62e","observation_id":"fea40679-2fe9-42ba-a4d7-980a8fee9702","resolution":{"observed_at":"2026-08-03T01:20:05.776188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.811946Z","title":"same action","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.811946Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:5a395dbcaf719e39c4b56a8e3c948f74f01981d822df780c56ddc45f0cd8fee2","observation_id":"81d0d2b5-30a2-433e-84a8-f77b306b15f0","resolution":{"observed_at":"2026-08-03T01:20:05.811946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.846442Z","title":"Training.We train with AdamW using learning rate 2.5×10−5 and weight decay 10−2, with total batch size 32 on 8×H200 GPUs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.846442Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:ba729807d9aa75308400b33afcea3b237291029ce8440d0b5128c61508d4491b","observation_id":"034ff4bc-f013-47ee-af42-a7fcc0f11675","resolution":{"observed_at":"2026-08-03T01:20:05.846442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.857938Z","title":"Boat Drive Forward then Turn Left","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.857938Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:73521afb8e25d29673bfe396003f345e37e561615b84313f68d24632db89d16e","observation_id":"76495e30-a435-4715-9b62-e47cdaa7142f","resolution":{"observed_at":"2026-08-03T01:20:05.857938Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.040281Z","title":"RELIC: Interactive video world model with long-horizon memory.arXiv preprint arXiv:2512.04040,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.040281Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:294efe6a52f194a0feb365f4694c93812f6a6cd723bd789f54090b3f6ff60d4b","observation_id":"20c1d0e2-b665-437f-b463-1a40d85220d0","resolution":{"observed_at":"2026-08-03T01:20:05.040281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:05.137444Z","title":"J., and Lee, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.137444Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:e5ba7390f9cb6594d1dcc8ef54adcfca55a2deeeec0c921c766b642c7a77c6f7","observation_id":"db35b54e-fa35-4ecb-8f49-6b8463e1bf10","resolution":{"observed_at":"2026-08-03T01:20:05.137444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-03T01:20:04.977462Z","title":"Mastering diverse domains through world models.arXiv preprint arXiv:2301.04104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.977462Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:7b03c62f83819e5c40599389367e37db0b30dedadab8ce72302446461f84bccf","observation_id":"663b81eb-0896-4230-b10f-c580c93de66e","resolution":{"observed_at":"2026-08-03T01:20:04.977462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13009","last_updated":"2026-04-07T11:37:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T15:28:53Z","title":"Matrix-game 2.0: An open-source real-time and streaming interactive world model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13009","snapshot_observed_at":"2026-08-03T01:20:05.012171Z","title":"Matrix-Game 2.0: An open-source, real-time, and streaming interactive world model.arXiv preprint arXiv:2508.13009,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:05.012171Z"},"links":{"cited_paper":"/paper/2508.13009","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:5fe09020d06d8c22e093bb750ab4afad6720f791e3b05c70245aabca142c8022","observation_id":"9b6a8d40-7881-4f8d-a1f3-0b8f701fccc8","resolution":{"observed_at":"2026-08-03T01:20:05.012171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-03T01:20:04.620117Z","title":"V-JEPA 2: Self-supervised video models enable understanding, prediction and planning.arXiv preprint arXiv:2506.09985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.620117Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:2dc78a7d3af64f29d51abb89a0203639636cd5994894d910d23d01f26bc0bb5d","observation_id":"612e5dc3-2012-409f-9649-c32baa742f19","resolution":{"observed_at":"2026-08-03T01:20:04.620117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:20:04.654870Z","title":"G., Habibian, A., and Ghafoorian, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.654870Z"},"links":{"citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:cf7f5f99db7ce2e2e92ed87ed6b3e16428691dc1cec69eaf3777aa5b8c201d9e","observation_id":"eb6b682b-51a6-49f1-9ce5-19aa58252902","resolution":{"observed_at":"2026-08-03T01:20:04.654870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-03T01:20:04.905745Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.905745Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:d2c68958bb55a6f20b071ea8273b0322deb6718797c714e19dcea45fb1cd1e4a","observation_id":"5fc3c6d6-0be7-44f8-87a6-27b7cc2f9438","resolution":{"observed_at":"2026-08-03T01:20:04.905745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2602.10104."}