{"as_of":"2026-08-21T06:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29ed520f88460f28389608f6755ed33e2093db77070e141b043e7a36fc77da88","coverage":[{"denominator":134,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:27:03.674229Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T01:50:30.699087Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30346","snapshot_observed_at":"2026-07-31T01:50:30.699087Z","title":"Y ocausal: How far is video generation from world model? a causality perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28624","last_updated":"2026-07-30T17:59:46Z","snapshot_observed_at":"2026-08-17T09:28:25.316512Z","submitted_at":"2026-07-30T17:59:46Z","title":"PhiZero: A World Model Built Around Physical Language","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T01:50:30.699087Z"},"links":{"cited_paper":"/paper/2605.30346","citing_paper":"/paper/2607.28624"},"observation_digest":"sha256:e6c12fd62551ad75846e53dd9cc8c96686b7bce4aebc483e61f71b11524c15a1","observation_id":"ae3c53d4-9262-4e61-9cc2-ec12667cc772","resolution":{"observed_at":"2026-07-31T01:50:30.699087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.30346/citation-record","integrity":"/paper/2605.30346/integrity","json":"/paper/2605.30346/citation-record.json","paper":"/paper/2605.30346"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Abdi et al","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:44bec59f4f4fd4fa917906dee2f54c6fbc0067c5592a4e7637e07bf574112060","observation_id":"307b6e9d-0081-4ffa-82f8-339237abf9d4","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:f46e4ab74041032758e07532281356d8749ed315ab6dc92c8cb2d15f0cd5ca5a","observation_id":"4ffec706-d9fd-4f98-846c-ab8135228985","resolution":{"observed_at":"2026-06-29T08:33:15.627170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:65874379e01e4e5b4e2f6dd7944833d0e44ddb4674a5e8f1af96fa6e71b1bc3e","observation_id":"1399a2bd-ef1f-43df-91d7-48154ce81b5c","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14378","last_updated":"2025-03-18T16:10:24Z","snapshot_observed_at":"2026-08-16T12:48:55.898946Z","submitted_at":"2025-03-18T16:10:24Z","title":"Impossible Videos","version":1},"cited_work":{"arxiv_id":"2503.14378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14378","snapshot_observed_at":"2026-07-01T10:25:41.408031Z","title":"Impossible videos","venue":null,"work_id":"5b20ddf4-07aa-4fa9-b1b0-e9f77b8d7345","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2503.14378","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:0fff7dfa0701f764dcd96696709c3c5463555727ae326b7a15b06b43f5842d42","observation_id":"49ff22ed-62fd-434c-bba9-1f9da543430d","resolution":{"observed_at":"2026-06-29T08:33:15.634414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Baillargeon","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:6825cddd7e4a2c54c61fe46105f905f4796c6f11be58ecd66612b33c976ec582","observation_id":"3215d2e9-cb9e-4878-908a-a9314096a7ed","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Baillargeon, E","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:e37ab56fce9fdd5e542ff970d556a06676f4095de8301ec302f5cc58da4e9665","observation_id":"5dc0f261-8383-473f-83a8-cd7d8f397104","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-08-16T12:54:37.000371Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":"2406.03520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-07-07T15:43:53.689981Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","venue":"cs.CV","work_id":"27ed795c-abbe-4de1-9a7a-2ecf39c354f3","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:b78b3efa6edbacff49415ce2e76f4083264cf3355946bc32611ec9f6007b4efa","observation_id":"9b8404ca-afc6-4e9e-aa33-302d0f6fa762","resolution":{"observed_at":"2026-06-29T08:33:15.608052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-16T12:51:43.372607Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":"2503.06800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-07-04T13:19:51.020711Z","title":"Videophy-2: A challenging action-centric physical commonsense evaluation in video generation","venue":null,"work_id":"4dfe3980-dfd5-4917-95e9-179c29e4eb18","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:ddddc696858bc18500dcdd516c81b3f0516ecc39f6f4f006f682b5b956217e19","observation_id":"b092f7a9-95a8-4f84-9bd4-cd2b18a83278","resolution":{"observed_at":"2026-06-29T08:33:15.610723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Bar-Tal, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:635d21f6b11728812ff7083e77e6d644bdbb90887190a430c6f341d8955c5e5c","observation_id":"b264e636-b3bc-40f1-97d2-73c76e6de273","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12000","last_updated":"2020-04-07T12:48:26Z","snapshot_observed_at":"2026-08-06T14:00:25.895988Z","submitted_at":"2019-09-26T09:34:48Z","title":"CoPhy: Counterfactual Learning of Physical Dynamics","version":2},"cited_work":{"arxiv_id":"1909.12000","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12000","snapshot_observed_at":"2026-07-04T00:29:15.546899Z","title":"Cophy: Counterfactual learning of phys- ical dynamics","venue":null,"work_id":"06369e64-377e-4d0c-a614-536c7b180480","year":1909},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/1909.12000","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:b055bbcccc2ad4f04b5ca146043289d109c4e5386853f8cc9134cba2187772e0","observation_id":"0476d5d0-3091-4ebd-a7a7-33f5fdc6c4f3","resolution":{"observed_at":"2026-06-29T08:33:15.613043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:502bcb5f192af1bd2763333935f45c9d12bbeb6b708bbca639ce1180aa90d70d","observation_id":"560d0ac8-77b2-4c7a-afd6-294ca8bf89e1","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08261","last_updated":"2022-06-20T14:27:21Z","snapshot_observed_at":"2026-08-16T18:16:57.747861Z","submitted_at":"2021-06-15T16:13:39Z","title":"Physion: Evaluating Physical Prediction from Vision in Humans and Machines","version":3},"cited_work":{"arxiv_id":"2106.08261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.08261","snapshot_observed_at":"2026-07-04T13:19:51.051888Z","title":"Blattmann, A., Dockhorn, T., Kulal, S., Mendelevitch, D., Kilian, M., Lorenz, D., Levi, Y ., English, Z., V oleti, V ., Letts, A., Jampani, V ., and Rombach, R","venue":null,"work_id":"8077bdbc-fa73-44a4-a120-92725975df49","year":2021},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2106.08261","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:2c9b74ab556284942960f4920e8c5d623e4ce9ea2e19da6c0433336779a0a909","observation_id":"155a3add-f8c0-4853-8c1d-eecb538cdc56","resolution":{"observed_at":"2026-06-29T08:33:15.597914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:a925d78b427bb2f1cab3215d3553961f25a8179380e5574c637e723323b565ce","observation_id":"ed9789d8-4070-46bc-b530-0b71af45e3a1","resolution":{"observed_at":"2026-06-29T08:33:15.592949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Blattmann, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:c2bee199228b5fabdd37fae493d985cf25997fa628ea8cfd9de58f14f323ed4f","observation_id":"4c655ad5-5332-476a-b4ce-750a1c4adedc","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09849","last_updated":"2025-06-11T15:21:16Z","snapshot_observed_at":"2026-08-12T15:10:44.435246Z","submitted_at":"2025-06-11T15:21:16Z","title":"IntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic Environments","version":1},"cited_work":{"arxiv_id":"2506.09849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09849","snapshot_observed_at":"2026-07-04T13:59:51.797306Z","title":"Intphys 2: Benchmarking intuitive physics understanding in complex synthetic environments","venue":null,"work_id":"6a27c357-5d91-401c-a3ad-3d9afc4b6f93","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2506.09849","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:46c007770ce2e6bcb933bdfdc57c326dd305641f2726f89a256931f03040482f","observation_id":"41c7a03a-a2a5-4dc8-8021-4a0f04c95706","resolution":{"observed_at":"2026-06-29T08:33:15.595374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Brooks, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:b472a89b9908e2861d561f4d0f7f015a69ff10e4aa7dc896ed8c1e720575c00e","observation_id":"54a82090-b09d-484f-969b-46e02038946c","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Bruce, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:0a5a9db3f7007715a523f0fff2ee750fc39aceae4088f008a4efb54ad406893e","observation_id":"ca72bed3-5e82-475c-ac1b-084a97c39d9d","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-16T13:09:28.872428Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:0f0489bdece6910494f31d0f7199839a1fd9084e9ab757891d50df637d03d707","observation_id":"2a848339-a283-4131-80eb-97e8b045757f","resolution":{"observed_at":"2026-06-29T08:33:15.588037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Chandrasegaran, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:fd73dd2eb42fc66c36e07be7411916b7966610423c53e44f506f76b7de197fc1","observation_id":"cdb194e8-a3dc-4a46-96cb-2d66aea1645c","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14206","last_updated":"2022-03-27T04:37:54Z","snapshot_observed_at":"2026-08-16T17:11:33.537886Z","submitted_at":"2022-03-27T04:37:54Z","title":"Denoising Likelihood Score Matching for Conditional Score-based Data Generation","version":1},"cited_work":{"arxiv_id":"2203.14206","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.14206","snapshot_observed_at":"2026-07-10T01:46:41.138725Z","title":"Denoising likelihood score matching for conditional score-based data generation","venue":"cs.LG","work_id":"c5c7088b-2299-4f4c-9abf-250c59a20268","year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2203.14206","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:a9fe550e7ca6225bed7c2dba42222d06c8bd5867ce1048397d4b7d48611d0ca4","observation_id":"b9ad9ba7-10aa-4803-8806-104d039b81cd","resolution":{"observed_at":"2026-06-29T08:33:15.585483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19923","last_updated":"2026-05-28T23:36:20Z","snapshot_observed_at":"2026-08-14T11:43:20.286474Z","submitted_at":"2025-11-25T04:59:55Z","title":"Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding","version":2},"cited_work":{"arxiv_id":"2511.19923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.19923","snapshot_observed_at":"2026-06-30T17:54:57.801096Z","title":"CounterVQA: Evaluating and improving counterfactual reasoning in vision-language models for video understanding","venue":"cs.CV","work_id":"2efd9312-f2fe-410e-85bd-ec6509b3cb03","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2511.19923","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:8b0fb8990694e07e7290981211dea01d68d27d0b358b7634d0ab4f23d5b31418","observation_id":"10f09771-c389-4cd4-8045-cf86e34fea3f","resolution":{"observed_at":"2026-06-29T08:33:15.583127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:eb24801850e58f8152e6acaf1e75103d613df40a85e2372d56f77f16b6404ceb","observation_id":"cd86e6ae-af21-41c7-87f8-28f2abaa9674","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Clark and P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:5b910be99c0f0db1426f36e7b3c5988cdad138aef1ae1a61aee26796e637cf6f","observation_id":"5f32fd7e-04ee-4cf4-98bd-e2d1c3af4725","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Cores, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:3cf0e4469b12d206be26d365520a5ce178a4c5fb4aa35e6cf4e35f4d820d04f1","observation_id":"1e074042-0fe0-4372-a225-85623af8c477","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Croitoru, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:715d6e41878bb327443386e1ddcd5d2b7bd0f4e1a1fd6cdd98fee4017725789e","observation_id":"74ee9c63-7c13-4c65-b725-a24b32bc8dab","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05836","last_updated":"2021-11-16T22:24:45Z","snapshot_observed_at":"2026-08-19T12:08:23.452873Z","submitted_at":"2021-10-12T08:59:19Z","title":"AVoE: A Synthetic 3D Dataset on Understanding Violation of Expectation for Artificial Cognition","version":2},"cited_work":{"arxiv_id":"2110.05836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05836","snapshot_observed_at":"2026-06-29T08:33:15.628280Z","title":"Dasgupta, J","venue":null,"work_id":"0c72880f-a16d-4eac-b5b5-20dd607e19d3","year":2021},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2110.05836","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:89f423b2454fc2498885e3bfa3bceb28f375a9661100e2cc415f4a44bb3138cb","observation_id":"cf893230-d3b1-49ac-a0e0-f707810abbac","resolution":{"observed_at":"2026-06-29T08:33:15.629676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Didelez and I","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:055d24c934ef4c53c7dcd18d2b3fa93e61b74c14483a80bd2029a4489956ed88","observation_id":"22d6f595-9d9e-4081-bf28-c113da5333a6","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10625","last_updated":"2023-10-16T17:48:45Z","snapshot_observed_at":"2026-08-16T14:51:40.234732Z","submitted_at":"2023-10-16T17:48:45Z","title":"Video Language Planning","version":1},"cited_work":{"arxiv_id":"2310.10625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.10625","snapshot_observed_at":"2026-07-08T03:14:31.687294Z","title":"arXiv preprint arXiv:2310.10625 (2023)","venue":"cs.CV","work_id":"9736ca18-78ad-4d25-ac93-df8f2295a1f8","year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2310.10625","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:fcf99680fde9930f7f50df84a59c871a8d5c7b7375ab4297889dc20e2b30d6f3","observation_id":"6739bce9-b662-412e-8ab5-10475c2e8519","resolution":{"observed_at":"2026-06-29T08:33:15.625184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Dummett.Principles of electoral reform","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:54da1f4a361792032caa703700332fe259a4307b7cdef80b8765d130a848b592","observation_id":"85261971-d20f-471c-a624-dfd6f59f12d9","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:dabeb42cb40da3cd4612c1751c8eda27930ea7a38c827470161a94160e7888c7","observation_id":"df3aebad-8f9a-48e8-82c4-9deeb1681dca","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Esser, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:512b2d7b374cad7f2e2df15dd1030d6960d3c68a5e98522287d6df2acca23a70","observation_id":"939d822c-641f-461a-935f-fd041ff66d67","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09943","last_updated":"2025-06-11T17:10:36Z","snapshot_observed_at":"2026-08-13T03:47:33.871757Z","submitted_at":"2025-06-11T17:10:36Z","title":"CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models","version":1},"cited_work":{"arxiv_id":"2506.09943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09943","snapshot_observed_at":"2026-07-04T12:49:53.095154Z","title":"Causalvqa: A physically grounded causal reasoning benchmark for video models","venue":null,"work_id":"4545b7fc-2bcc-44f3-a395-c6684aede4c7","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2506.09943","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:638337bcda80baeca8cbab32d50fee4588575ac56a12304b2e4ec7e4b83515eb","observation_id":"db74685d-7bbd-4d2a-adb2-3fea251bfeaa","resolution":{"observed_at":"2026-06-29T08:33:15.575730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:7508b361843f1d3d52cc2bbd8e53cceb6dc011022a8bdf3723b06d6462125cc9","observation_id":"8ce27312-3b26-481d-8608-785a9514c7f2","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Gandhi, G","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:bc955c4f5c873bbe55af6f5cd4d252ec04b32315877ea3f5bba909786f2d87dd","observation_id":"7a249aeb-0252-4214-bd0d-6d8f70277c23","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11831","last_updated":"2025-02-17T14:27:14Z","snapshot_observed_at":"2026-08-16T12:57:42.825389Z","submitted_at":"2025-02-17T14:27:14Z","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos","version":1},"cited_work":{"arxiv_id":"2502.11831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11831","snapshot_observed_at":"2026-07-04T15:49:58.028816Z","title":"Intuitive physics understanding emerges from self-supervised pretraining on natural videos.arXiv preprint arXiv:2502.11831","venue":null,"work_id":"e57b6325-f361-44d2-86e0-dcb7cf4e46dd","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2502.11831","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:673cad6c5e2cc332467926e89fd56dcd1101cb8d5cbaa625e057f3a41cd8cd36","observation_id":"34793af0-fccd-4d4d-aa67-45ddb3471636","resolution":{"observed_at":"2026-06-29T08:33:15.573118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:62f93870b95b7551a6e06fe973a0a2e24bb9eb4c89268dcf03bded2020da1055","observation_id":"d8822baa-be1d-405e-8315-d1249a86f9f8","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Girdhar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:3c94f36a1bc4ead899829ade48f9e5dae1a322afa131bae75cfb26b594c98dc6","observation_id":"37370f34-d5a4-4441-a04d-98e8537e82cc","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":"2307.04725","doi":"10.48550/arxiv.2307.04725","metadata_source":"pith","pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","venue":"cs.CV","work_id":"1f9d1d3b-a6d6-45a9-9f13-51393c03be8a","year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:017c949f14a23b41f9d7fb3405a837ec4ceb975ae69b7b019021fa9185ee2d0a","observation_id":"c21c8ba5-1957-4820-85c7-63dadb2b121c","resolution":{"observed_at":"2026-06-29T08:33:15.578324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Gupta, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:e8932f393007ee995835c05a81aee2725fe2d183f9f4eb88ad3d4496487b2601","observation_id":"84419607-c037-4abe-af27-cf8e6b2ba6a1","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-08-18T07:04:58.690133Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:bfd4924ed794bc63fea615fbf50a5c5f1ca2bbb3fbed34ab9103051b1f445e0f","observation_id":"d0668040-4775-4a25-ac43-6d6dad199f3d","resolution":{"observed_at":"2026-06-29T08:33:15.580584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:3574aa95f3589b39cf44ef3b2b31298a1c993b26667ba3ec2d15d047e8eb6846","observation_id":"f3ac810d-6301-4b7b-8174-12df40c75152","resolution":{"observed_at":"2026-06-29T08:33:15.590526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Hafner, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:f6107da482eb6ad8c370550625293482720d6947774706cbd861111dfb04cb68","observation_id":"0c033d00-50c3-44b0-b646-7bae69712ee6","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-17T02:57:21.304714Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":"2010.02193","doi":"10.48550/arxiv.2010.02193","metadata_source":"pith","pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Atari with Discrete World Models","venue":"cs.LG","work_id":"154f6f5f-bb34-456d-8107-45d5b51433ce","year":2020},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:efe7c16122b6fbb0466529453c9a305c933d8027ee97eda0b63e9ff77919e932","observation_id":"9cc9065f-e5ae-4dac-927d-b78288d3230f","resolution":{"observed_at":"2026-06-29T08:33:15.600367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Hanyu, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:9d14f63d6083d51f84935df92987c4f2871cdef8880ce39adfe949c521900c8b","observation_id":"84272f10-3136-41d2-9af4-572446bbb134","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:950f61f6412872f721a12b073817c93c7aa56ae042e085dd7b951f3a8d471fc6","observation_id":"991b9e5a-b152-47ae-a4ff-c942ce886c5c","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:01b8b69e1782ae1b4d10f8834ba366c714b69941ab93c7fa05ac0149880c202f","observation_id":"7a06bb04-6dc5-417b-a483-98cacf951761","resolution":{"observed_at":"2026-06-29T08:33:15.615247Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:caaa624aeadbe0512525ce95e5f5322ae22778dd17065950e5a6327b07d6435e","observation_id":"15abae2b-e86f-467b-97a9-53f138eeddbb","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:81ad798f99b1fd2d5618405d4d7a28bb51c41a80908402ca33b30a596b76af7a","observation_id":"d378a0e0-3f2e-4b20-8f05-1c3feec1cd37","resolution":{"observed_at":"2026-06-29T08:33:15.620476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2309.17080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-07-10T11:47:02.949785Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"313484e6-a442-4522-8e19-d07e502844a8","year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:89f24bc6768224e392e8cfca0b63b24832c11c4b605ce20e0745a2b0aedf69ca","observation_id":"2c871516-a9c3-492f-b756-10b4bb90f39d","resolution":{"observed_at":"2026-06-29T08:33:15.532440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Huang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:66bae34e25fe3eb391b26e3ebf610bbcbdd6eaeb9f4d8d31ccc5459c4df2b2b0","observation_id":"24ee306d-9dcc-428b-99ef-1fa3fafa75ec","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Huang, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:02e17965c709a79e6561b5f721dd7cdd1af45b4273d597c717725e7d11520b47","observation_id":"f0d562ed-466a-426d-92ea-5e27b7cd974f","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:4a8058bee9854c50ab7e3b29c895d6bc08bb35bbe678ba830b039372a74c0e1d","observation_id":"3a7efd08-e208-4cba-8ac4-e3a38dd39c94","resolution":{"observed_at":"2026-06-29T08:33:15.544371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:21d7d398d827fca44b5c177f02dceaeee49aa7b5c0f65a02997489889931efb7","observation_id":"10479d59-1e82-466f-878b-155b761c59a5","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05836","last_updated":"2024-04-17T04:27:10Z","snapshot_observed_at":"2026-08-20T18:08:43.065544Z","submitted_at":"2023-06-09T12:09:15Z","title":"Can Large Language Models Infer Causation from Correlation?","version":3},"cited_work":{"arxiv_id":"2306.05836","doi":"10.48550/arxiv.2306.05836","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.05836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":"arXiv (Cornell University)","work_id":"c8fe696f-277f-4d46-be0b-42e8f62e09d4","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2306.05836","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:aad2961a131d47193fa4d515594a944af49cae57969a69ac9e5f0fec371d0600","observation_id":"cf50a9f9-02fd-4a5e-af6f-23fc5c1647d8","resolution":{"observed_at":"2026-06-29T08:33:15.544362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-16T02:35:29.869873Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":"2411.02385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-07-08T07:14:45.230404Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","venue":"cs.CV","work_id":"4459ec7e-7a67-4b25-9c04-e91d87bf1b63","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:baae9cb72cd40586373b1e8532dfcb8d64257d50db1563fd35594522406edf6b","observation_id":"4aeab025-8373-4f11-91bd-b39a6d212011","resolution":{"observed_at":"2026-06-29T08:33:15.537554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:7ce4526b20272a4eb9c6929b25bb4c460a2c8e06d38ba813658bad82a718d0cf","observation_id":"b2630d93-81b6-45d1-81b8-11ae5f5f49d4","resolution":{"observed_at":"2026-06-29T08:33:15.570164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-20T22:03:51.775198Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":"1705.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-09T11:16:11.423695Z","title":"The Kinetics Human Action Video Dataset","venue":"cs.CV","work_id":"c8a3de61-cfd3-4aeb-bcf7-a0372c015748","year":2017},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:79763e8ad8aae1a1d4a28a1fd350f0033498c20864ef13b55a5c0ff2345877b9","observation_id":"f0612853-db1e-4a36-accc-2a36c53cf791","resolution":{"observed_at":"2026-06-29T08:33:15.622786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Kiciman, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:53a8782604a183f47d29fdf7b5c5bd7da995351affe86a38b13d4f6ebb16d10f","observation_id":"c019ae63-55bf-432d-a413-d7dadd6f8bf9","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Kingma, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:97467b46f9ce94c49c98d6cfc67b10ead8b82c826a4f50ef0dab9656d448d496","observation_id":"edc2573d-6713-4212-9abc-57cd2141bbde","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:d76db6c5d7126c7d8077a9038ad89e5d5b148701a26039e79b9f015035f519ef","observation_id":"8ed48a88-b16f-4e57-aa11-e5a8136ba46c","resolution":{"observed_at":"2026-06-29T08:33:15.532361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:4317b7bf5d3dbf0bfb4af46b560462d2ef3b0fa6d0041735976f968714288ff2","observation_id":"d31f2d72-97a6-4a65-9a9b-58c98d85b190","resolution":{"observed_at":"2026-06-29T08:33:15.598875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:d4cfcb3e9d9ab838bd49299b160900e0b388352762c4ef8e40286b1677ad7b45","observation_id":"de54c87a-71c6-4802-b262-fd1352f236a7","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:0d7ce10175cb28584595529170cebb10f95f69d475084c357b27f5d0c004c4c3","observation_id":"3d97964c-db6c-4d3f-a6d2-40fbf2a655b4","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"LeCun et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:117ad4c0d3c8aa7f663944bd40f417e46f2841fae8f0c643fb87b92140516e5e","observation_id":"d5f7098c-47ff-4090-ad46-e9bf45815867","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:bfa7cbdc8f74170e25e95d6b52841983c7890bddfb457b4e5be536f35298434b","observation_id":"5f15c812-f716-4d7f-a57e-8f7b446c5b2e","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:d786e245cde0329538e7d5f2720c9f21a5a96a9b09a753cfec5ce1d068ed15ec","observation_id":"74ad1133-6676-44fe-a6b3-d314d4aa5a0d","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09595","last_updated":"2025-03-12T17:58:14Z","snapshot_observed_at":"2026-08-16T12:50:39.595126Z","submitted_at":"2025-03-12T17:58:14Z","title":"PISA Experiments: Exploring Physics Post-Training for Video Diffusion Models by Watching Stuff Drop","version":1},"cited_work":{"arxiv_id":"2503.09595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.09595","snapshot_observed_at":"2026-07-04T19:20:05.829234Z","title":"Chenyu Li, Oscar Michel, Xichen Pan, Sainan Liu, Mike Roberts, and Saining Xie","venue":null,"work_id":"77734b88-407c-4b52-b05b-f4805374eab5","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2503.09595","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:d6201ca630db9e57faf1c76c1439473eece0affba4c93c43f39ccdbd2b6b37fa","observation_id":"beea9972-ed1e-4ae4-9f89-025c73af872d","resolution":{"observed_at":"2026-06-29T08:33:15.524456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20694","last_updated":"2025-02-28T03:58:23Z","snapshot_observed_at":"2026-08-16T12:54:26.116596Z","submitted_at":"2025-02-28T03:58:23Z","title":"WorldModelBench: Judging Video Generation Models As World Models","version":1},"cited_work":{"arxiv_id":"2502.20694","doi":"10.48550/arxiv.2502.20694","metadata_source":"pith","pith_arxiv_id":"2502.20694","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Li, S., Wu, K., Zhang, C., and Zhu, Y","venue":"cs.CV","work_id":"33a5087c-1633-4d52-b891-f34d10b9e7c8","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2502.20694","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:10eaf184faadf5b7131d1d4cc40fe6f49318a9c1d8339860939fa8f84d26c79b","observation_id":"451d3f56-0ced-48eb-8247-7a1b1d1a4be6","resolution":{"observed_at":"2026-06-29T08:33:15.524747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:51.214081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:51.214081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:91f30d14e107f5ef1eeab71046a88f959b70850ed8ee1cd11d609b481e3dc88c","observation_id":"3cd5ce6f-0089-494c-9b54-4e1b1f4b40d0","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:823d7b645a68d65c72f1e11520422eba1a979a18aad3e489679d4eaa925bd77c","observation_id":"176be4f2-61b5-4e90-895b-5f59ce111b0a","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:d378b97c96c1ffcc5f2c09de011fe9a8624216271d88aa92aacad8c9f8685819","observation_id":"33c48868-f619-4c66-b0a7-103c257d18c9","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12966","last_updated":"2025-04-17T08:05:10Z","snapshot_observed_at":"2026-08-16T13:59:25.255308Z","submitted_at":"2024-04-19T15:53:27Z","title":"Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning","version":5},"cited_work":{"arxiv_id":"2404.12966","doi":"10.48550/arxiv.2404.12966","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Version 5, last revised 17 Apr 2025","venue":"arXiv (Cornell University)","work_id":"aeb208e8-849c-442e-a6f8-32af2a17c448","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2404.12966","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:1d730bdc2f35c95b31a028d82793368f93c0451dfd1ca7a2bc7035e3d10d91a0","observation_id":"b0a75303-cb93-42da-8735-7c105f8d854d","resolution":{"observed_at":"2026-06-29T08:33:15.627620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.08184","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:29.493719Z","title":"Scaling laws for diffusion transformers","venue":null,"work_id":"c63ab8f7-e19b-480c-9b0f-2ac18549ef65","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:e59601c16e0eb3a907ab854ec5e7a03c60079ddf90d93925dfdfc1380ba35b66","observation_id":"603e475a-5e4c-4d19-9d9a-201b37299406","resolution":{"observed_at":"2026-06-29T08:33:15.619743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01399","last_updated":"2024-05-31T15:32:02Z","snapshot_observed_at":"2026-08-17T17:09:51.857542Z","submitted_at":"2023-07-31T17:57:49Z","title":"Learning to Model the World with Language","version":2},"cited_work":{"arxiv_id":"2308.01399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01399","snapshot_observed_at":"2026-07-04T17:50:00.037807Z","title":"Learning to model the world with language","venue":null,"work_id":"7d40b119-107a-4666-9ae9-cca8e71ec480","year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2308.01399","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:835e81a6cf1c642b5092972110ae093beecdb04e8086f15af555a8420a0c1230","observation_id":"25052069-fbf5-4152-bd0f-67b4ac81ab5e","resolution":{"observed_at":"2026-06-29T08:33:15.593963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.964095Z","title":"Can world simulators reason? Gen-ViRe: A generative visual reasoning benchmark","venue":null,"work_id":"04240c59-0a34-48a6-8ca3-26dde22f21bb","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:ed0efb4b5a637061484a34e680ef48233665d4659085b406062e4d4dd3676887","observation_id":"2162068a-4e87-4da8-9d64-26d4dd16d6ae","resolution":{"observed_at":"2026-06-29T08:33:15.490643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:53fe53b95b7e26fcf91f2f10182a5671f5427158e716f685b274530c038a7ac0","observation_id":"abab41e9-c010-4b7b-8851-cb2098433939","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":"2402.17177","doi":"10.48550/arxiv.2402.17177","metadata_source":"pith","pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","venue":"cs.CV","work_id":"49aeafea-5763-4b8e-aff4-8fa617aacb1f","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:6eeca3d2151d4f591372952cf30c6befd22222cec2bb4135781ad3de3a8080f3","observation_id":"bdd9e24a-df85-4897-a886-1464b2dc9aca","resolution":{"observed_at":"2026-06-29T08:33:15.508750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Margoni, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:0a30abd1b8f728eb679bdf07f1d619f4c622b5aff2649815681d70bc3064ecec","observation_id":"a56c8181-4368-468e-b5de-2e0473edf09c","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Matsuo, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:e99a75187d2aaf141cdbba0c981955505604e0978c540fa5a84ec759556b4b0c","observation_id":"7e2499e6-1b39-498a-9478-deada579336a","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:6138fa7349791bce50314861d5beea80ebecf530c372b1c219a8310fcf777998","observation_id":"58a59609-d735-4e91-b83c-1b8a32969d29","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":"2410.05363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-07-08T07:14:45.198485Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","venue":"cs.CV","work_id":"644e2886-7387-436d-ac11-d848af5fcc71","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:f7e2833d4e071b524270406d924bd7646eb7f768688cde9b8dd1b476c408e88a","observation_id":"16df36be-8af9-4bfb-89be-8b56e27a6ef0","resolution":{"observed_at":"2026-06-29T08:33:15.488717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Michotte.The perception of causality","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:3cfcadaf5b4bfd01677eccaa17a39e7ef5844e0d8ba36de9313156868647a19a","observation_id":"108ef104-3fd5-44ac-bcd4-88dad1802da2","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Misra, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:88c33834fdc1496a9aca0ba9e92e7cbcb262ed05b4efe7dcdc4eb85029654970","observation_id":"99cc7339-711d-47e3-9bea-8e379c6bedb8","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Monfort, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:bacb279689a2b11c433bb36c7d3b09aa44b17c0b249740bcaf94ac034b83485a","observation_id":"f2e33d3d-4716-4996-8778-f8dd5069930e","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Motamed, L","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:a7f2b4bb010bcc6b4d21b065ed9859630d2de2639a0a26beb5f0a683debb9b4c","observation_id":"81a555a2-2121-47fe-84df-f5247e026ce6","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:562c61ab5dd5bbd8d643ab3081e56d8931913ef3d8f4b6d896654221db944271","observation_id":"cfd0a2e5-1add-4c62-a156-7812606823ed","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:4243a60e902965c7efdc3a2d12b49f80cef21cc5eb681d619abf0ec6c7142122","observation_id":"a5efac3c-bdc1-436c-a807-a9659efbf2b0","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Patraucean, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:bc72b5270ce671cdb240b7f49c3320e8ec8099bf14d7abfbb63b6f64768d0f54","observation_id":"7d778eb7-8743-470a-aef4-bb43a1270c8b","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:0e1352cd58256f3908e20b855daa27731250b4464cd8e29128113aff34f02827","observation_id":"12d0b433-2c50-4ab4-bc99-64b044ddfbcd","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-14T22:40:32.716624Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":"2503.09642","doi":"10.48550/arxiv.2503.09642","metadata_source":"pith","pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","venue":"cs.GR","work_id":"c22f9060-268c-4cc9-8018-dee486a23da1","year":2025},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:243d37c08464e159b37710b96b6097e8ceda694dc5df047335ae1d3d652b2fdc","observation_id":"6f8c9d2e-f6a6-448f-9c47-a625c0be4b26","resolution":{"observed_at":"2026-06-29T08:33:15.519319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2035},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:e819fcaf7384f2cc3852ffb3d9459891780ea1399a51d0ed8696508a61adb4e4","observation_id":"d0a433e5-2c70-4170-b88f-67e613481a55","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:601b4fb90cbd728de6633ce4c4aedef66cd91be5b1fc0aabf153c04dd4745033","observation_id":"77a05554-9c9a-44dc-8d1a-6c60eaece6fb","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:eb726f60d7c7e829a5c2abcac0363bbf019d543df89b309a7a048d5408335d94","observation_id":"ad07360e-9ce7-4a67-953a-19e74de03b61","resolution":{"observed_at":"2026-06-29T08:33:15.622095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18072","last_updated":"2024-10-23T17:56:11Z","snapshot_observed_at":"2026-08-20T03:11:07.940068Z","submitted_at":"2024-10-23T17:56:11Z","title":"WorldSimBench: Towards Video Generation Models as World Simulators","version":1},"cited_work":{"arxiv_id":"2410.18072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18072","snapshot_observed_at":"2026-07-08T07:14:45.281301Z","title":"Worldsimbench: Towards video generation models as world simulators","venue":"cs.CV","work_id":"fb0a629d-b02d-49d2-9009-af5192360e0b","year":2024},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2410.18072","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:c43cee466783a5a17a9cb044bb5e8d6b72b3d66b9d520fd38d4dda4ec0101a95","observation_id":"104f088e-48c5-436c-b74a-7589a2784258","resolution":{"observed_at":"2026-06-29T08:33:15.603867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07616","last_updated":"2020-02-11T10:05:20Z","snapshot_observed_at":"2026-08-20T06:03:22.021052Z","submitted_at":"2018-03-20T19:29:46Z","title":"IntPhys: A Framework and Benchmark for Visual Intuitive Physics Reasoning","version":3},"cited_work":{"arxiv_id":"1803.07616","doi":"10.48550/arxiv.1803.07616","metadata_source":"arxiv_reference","pith_arxiv_id":"1803.07616","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rodriguez, J","venue":"arXiv (Cornell University)","work_id":"d53bffe7-b38d-42b7-8c9f-70c89156ba20","year":2018},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/1803.07616","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:9782db3ea3f8edbd5ff7e33e7f82cdaeaa7b9e6478daed91bd95ecd59580c522","observation_id":"0f2cf9cb-f18d-414c-b98d-fa02b47f22fe","resolution":{"observed_at":"2026-06-29T08:33:15.537099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Riochet, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:9a9b27c896081e959d9f78c5c01e2e3731c9f0e72d17866472203883bc27f7e3","observation_id":"1667a74f-a02e-4056-a225-1054701caad0","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:79731acca6b17dc4f8b6e9d095040cd422a955d1572b5ddddc1b64bfca05c599","observation_id":"0b649f53-987d-4981-83a0-a7441ffe941a","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":"2209.14792","doi":"10.48550/arxiv.2209.14792","metadata_source":"pith","pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","venue":"cs.CV","work_id":"52a801fc-a707-45a1-a8cd-0d6702f124ab","year":2022},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:e84911d1b49b1ca5854049c30430e58487a7444f432ae63044553ddec4f65b79","observation_id":"7e1d9a58-c33e-4fa6-af20-705816eccbc9","resolution":{"observed_at":"2026-06-29T08:33:15.553075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Smith, L","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:a957ad57564ebac3e2c892acacec33f2c03606cc8195bada74407e1f9306f5fd","observation_id":"cf9cd22d-9cbe-4cca-ad67-18c8afda79d8","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:27:03.674229Z","title":"Sohl-Dickstein, E","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-29T08:27:03.674229Z"},"links":{"citing_paper":"/paper/2605.30346"},"observation_digest":"sha256:bac128b409b5e20a1e5c558f731ada9511f7629d7d216cd85a5ed1125d22911b","observation_id":"9af9f33f-14f6-4c4b-acf7-d9f1e3fd467d","resolution":{"observed_at":"2026-06-29T08:27:03.674229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.30346","last_updated":"2026-05-28T17:59:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T10:14:05.552405Z","submitted_at":"2026-05-28T17:59:51Z","title":"YoCausal: How Far is Video Generation from World Model? A Causality Perspective"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":42,"verified_fuzzy":0},"total_outbound_references":134},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 134 outbound references and 1 inbound Pith citation observation for arXiv:2605.30346."}