{"as_of":"2026-08-06T01:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bbf9703463f981103db452fff81365a8aff477c9499fea0f6da5af4a5a4da75","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T23:01:13.546110Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":134,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:05:46.912489Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T18:05:46.912489Z","title":"arXiv preprint arXiv:2511.00062 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15163","last_updated":"2025-08-21T02:01:49Z","snapshot_observed_at":"2026-08-05T18:05:41.150064Z","submitted_at":"2025-08-21T02:01:49Z","title":"Non-invasive Assessment of Pancreatic Duct Hypertension Using Computational Flow Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T18:05:46.912489Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2508.15163"},"observation_digest":"sha256:03097167981eb1cc3c9dbebe38f977c3aa6eaae87915e716b1cefb02a6035ad4","observation_id":"3f536bf9-a60d-45b9-8dfa-2c26111dbfac","resolution":{"observed_at":"2026-08-05T18:05:46.912489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-03T21:14:08.241793Z","title":"World sim- ulation with video foundation models for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17649","last_updated":"2026-07-07T04:04:31Z","snapshot_observed_at":"2026-08-03T21:14:07.753245Z","submitted_at":"2025-11-20T09:52:20Z","title":"SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:08.241793Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2511.17649"},"observation_digest":"sha256:4c1b1fcb6787370707cbf0020f9ef130f5272d7e9de3e9ca08a7d38bd3e3c7d1","observation_id":"b3a173d5-3c1b-43f1-b9e8-e75981a48582","resolution":{"observed_at":"2026-08-03T21:14:08.241793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2511.23230","last_updated":"2026-04-04T17:59:32Z","snapshot_observed_at":"2026-08-02T21:48:00.220191Z","submitted_at":"2025-11-28T14:40:03Z","title":"Action-guided generation of 3D functionality segmentation data","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T04:49:06.269256Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2511.23230"},"observation_digest":"sha256:5abae9d46f9df96d530de1c45875cbe1762f71ce6828cacb0084380029b74655","observation_id":"19866105-002a-4d37-a1c4-952a478a6906","resolution":{"observed_at":"2026-05-17T04:51:31.961334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T10:41:00.142543Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2512.15692"},"observation_digest":"sha256:d03b51d45aa7598dbe52003d3ea411142e0579e06e3c0a3ccc22a1568113787c","observation_id":"ffb8ebf1-a0b8-4ab6-b101-e4f911ddd5bf","resolution":{"observed_at":"2026-05-15T10:41:00.371735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2512.17445","last_updated":"2026-04-08T21:08:41Z","snapshot_observed_at":"2026-07-06T22:39:33.919723Z","submitted_at":"2025-12-19T10:57:03Z","title":"LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T20:56:58.770875Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2512.17445"},"observation_digest":"sha256:60668b686f1d380f11abcece1ca55e8007e7724dc9dc2ba55748ee0ec841ba27","observation_id":"0ea168d0-4a6f-44bd-9c15-f0726a94a156","resolution":{"observed_at":"2026-05-16T20:58:31.824406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T19:23:58.769472Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2512.21714"},"observation_digest":"sha256:327fc0b4fc000318df73eabfd580c762eee1703284d5e721af3ce8c10e77d697","observation_id":"42fe7b14-e06f-41cd-ac2d-85ccf240be77","resolution":{"observed_at":"2026-05-16T19:28:20.868354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2512.23421","last_updated":"2026-04-17T11:51:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-29T12:32:27Z","title":"DriveLaW:Unifying Planning and Video Generation in a Latent Driving World","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T19:34:39.518649Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2512.23421"},"observation_digest":"sha256:1ccbb236464d497c96c14abd857322a5a907da601c02bb7c1c609fd4070b9358","observation_id":"0c5207d5-c917-4f4d-a024-e34e56eab943","resolution":{"observed_at":"2026-05-16T19:38:21.104574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-03T12:37:28.494262Z","title":"World simulation with video foundation models for physical ai,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02295","last_updated":"2026-07-28T17:46:45Z","snapshot_observed_at":"2026-08-03T12:37:21.822048Z","submitted_at":"2026-01-05T17:31:01Z","title":"CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T12:37:28.494262Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2601.02295"},"observation_digest":"sha256:e8d11d033ec4a48c912b0b39482cbd3471a26d8133f23d4602f0b6deda243f9a","observation_id":"0110820c-4239-499e-a7bd-9fce4a723f27","resolution":{"observed_at":"2026-08-03T12:37:28.494262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T09:07:00.904794Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2601.20540"},"observation_digest":"sha256:82502086967c3ffc256c8a74fc96adb99dc6e3130302f41548eade5415ae4f15","observation_id":"cd8451bc-67de-427e-94c8-e4efbcaf06f5","resolution":{"observed_at":"2026-05-16T09:07:00.942546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-03T03:56:47.126834Z","title":"World simulation with video foundation models for physical ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06508","last_updated":"2026-05-25T03:56:37Z","snapshot_observed_at":"2026-08-03T03:56:46.452714Z","submitted_at":"2026-02-06T08:57:55Z","title":"World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:56:47.126834Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.06508"},"observation_digest":"sha256:37d2ac5e7164a4524099de425a65f136d6432482fe394f47f2c14d0dc53e0105","observation_id":"f9612596-cb44-414f-bc59-5f979c5d309c","resolution":{"observed_at":"2026-08-03T03:56:47.126834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T17:02:33.997887Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.06949"},"observation_digest":"sha256:44f5e91e0856ef5036266921eac43677df7d0fc1d0ddd538de753563979f95cd","observation_id":"e9d9abb1-f484-4fe4-8a09-de5a2e057d81","resolution":{"observed_at":"2026-05-16T17:02:34.267430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T07:02:38.876518Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.07775"},"observation_digest":"sha256:cf94bd58ec158fa90eda89329b19a722d1551ba44d8de0b9df90dd3ed5fe37a6","observation_id":"7332bf28-128b-4f1d-95c3-82f7f3f881f3","resolution":{"observed_at":"2026-05-16T07:07:30.032697Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T02:28:37.997148Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.11075"},"observation_digest":"sha256:7df7f25eecf92f74a585d2706031a9f887cfe01ce2fc4cfdeadea7b60938fa30","observation_id":"d218176b-7e28-444f-b351-30d5d2c1c658","resolution":{"observed_at":"2026-05-16T02:30:32.148569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T16:18:15.003371Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2602.15922"},"observation_digest":"sha256:04625068ba17b1ad1befd3b0f8b4b8d1c8cb7efa13bccb4c3d16e82b085c7c79","observation_id":"e8de21ed-7a5e-4bd5-aa18-5e3d79c67d72","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2603.11755","last_updated":"2026-06-29T14:21:14Z","snapshot_observed_at":"2026-07-14T22:39:44.966501Z","submitted_at":"2026-03-12T10:02:23Z","title":"Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T12:18:45.538658Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2603.11755"},"observation_digest":"sha256:a5ff330200cfa7f90a99e02f9ae476ce6d8c7b7815ec161f0424bb968adf0724","observation_id":"fd1e209b-bbf7-4fd5-8078-18c3e1614fa1","resolution":{"observed_at":"2026-05-15T12:20:00.593719Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-08-05T11:17:52.410204Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T01:35:14.878069Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2603.28489"},"observation_digest":"sha256:e89b50e34a64d082c9a42e57fca40d0b8326d6bd238a707c7b9e19b46b94a307","observation_id":"829bb067-274d-43b5-9162-ab1af4f452bf","resolution":{"observed_at":"2026-05-14T01:38:36.297567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-03T02:31:02.007136Z","title":"arXiv preprint arXiv:2511.00062 (2025) 4 TRACE 19","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01207","last_updated":"2026-07-31T06:47:55Z","snapshot_observed_at":"2026-08-05T23:10:26.447101Z","submitted_at":"2026-04-01T17:51:00Z","title":"TRACE: High-Fidelity 3D Scene Editing via Tangible Reconstruction and Geometry-Aligned Contextual Video Masking","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T02:31:02.007136Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.01207"},"observation_digest":"sha256:ce50270ecfaa6a9f498223409e261f1f72bd7ea1b369a3749695e7130077caa4","observation_id":"a553edc2-0934-4d58-81eb-de4ec5248f1e","resolution":{"observed_at":"2026-08-03T02:31:02.007136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.01907","last_updated":"2026-04-24T08:02:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-02T11:26:44Z","title":"Lifting Unlabeled Internet-level Data for 3D Scene Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T22:16:57.890955Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.01907"},"observation_digest":"sha256:a00888ce5e6fb013f486badc59a4182d16b81d96858569d060636bb1222e8466","observation_id":"f428f70b-ebc1-4390-bd81-c670992afeec","resolution":{"observed_at":"2026-05-13T22:18:21.015364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:36:42.100191Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:8025ab120a69d68799c898939676ba32a26c038d996f23cfe4d0bad5366bf98e","observation_id":"d7239c86-ffbd-4f65-8fc4-5d87d982b5f2","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-07-13T09:42:23.808691Z","title":"World simulation with video foundation models for physical ai.arXiv preprint arXiv:2511.00062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T09:42:23.808691Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:1782c5d77aae753bd38c435118d13582afd1f86676ddf2c88884abfd87dff95b","observation_id":"d6ab8ce6-250c-4191-aa3f-8b7db6070145","resolution":{"observed_at":"2026-07-13T09:42:23.808691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.06168","last_updated":"2026-04-15T01:21:52Z","snapshot_observed_at":"2026-07-06T22:54:44.656835Z","submitted_at":"2026-04-07T17:59:30Z","title":"Action Images: End-to-End Policy Learning via Multiview Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:05.206602Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.06168"},"observation_digest":"sha256:b6828006ea5a98371c62db4febf3be3fc6ddec743a98bf82500ea9fce432c4c8","observation_id":"abdbe0d3-d15a-446e-b6c7-e80340e0ec62","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.07990","last_updated":"2026-04-26T05:22:47Z","snapshot_observed_at":"2026-08-03T01:37:14.104908Z","submitted_at":"2026-04-09T08:59:33Z","title":"SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:23.355682Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.07990"},"observation_digest":"sha256:87df6c982d82ccff8545e4789f8f6a071ba92e928dc12fdaee22ac1ca8f9fce6","observation_id":"422b8182-9835-4b95-95b1-4473873e0e50","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.07991","last_updated":"2026-04-09T08:59:40Z","snapshot_observed_at":"2026-07-06T22:57:09.435331Z","submitted_at":"2026-04-09T08:59:40Z","title":"MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:11:14.242522Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.07991"},"observation_digest":"sha256:d686098799156ae4bdda7e7f6d3aefe56ebf30ffb999faf0dd1673f18c06b2ab","observation_id":"83cdf01c-32a7-4a92-9d8d-2a7220f58fed","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.11707","last_updated":"2026-04-13T16:42:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T16:42:46Z","title":"Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:53.578491Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.11707"},"observation_digest":"sha256:a9ff3b699ea1cc2fb7de56fba0d0166d9f967eee57b13b2b27b03b1bdfc46846","observation_id":"50bb55b6-4159-413c-abc3-14c00f504715","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.11797","last_updated":"2026-04-14T21:52:23Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:58:06Z","title":"SyncFix: Fixing 3D Reconstructions via Multi-View Synchronization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:20:04.440192Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.11797"},"observation_digest":"sha256:5dff294c77e4c3d7901de719923bf5066a9abb6297cf54f1bfb732faab764d73","observation_id":"780fa249-5e2b-40b1-9161-f5c2d82e6cbf","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.15569","last_updated":"2026-04-16T22:55:39Z","snapshot_observed_at":"2026-07-06T23:03:07.228701Z","submitted_at":"2026-04-16T22:55:39Z","title":"ShapeGen: Robotic Data Generation for Category-Level Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T10:17:05.939312Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.15569"},"observation_digest":"sha256:4a61da7f05c7d94ccfba9cbe7776f6eae0e2669c32f65d866075dc2a6874b7a1","observation_id":"479e6cdb-9b9b-4c34-8193-940ee358f451","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.15805","last_updated":"2026-04-17T08:06:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-17T08:06:26Z","title":"From Seeing to Simulating: Generative High-Fidelity Simulation with Digital Cousins for Generalizable Robot Learning and Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T08:45:46.944379Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.15805"},"observation_digest":"sha256:fceffe13dfa474324dde993a0e1bd82432fe1a39a65c5f45e2ee3b389e218244","observation_id":"0ed5f6d6-1d1c-4220-bacc-ff5fe532e494","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:3d8b52f4f66379f266701b6eae7b6baae96077a8fa268c714d8e30e3cf072cf0","observation_id":"062bf222-1e5a-4795-80f6-c44d909a736a","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T06:03:06.920592Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:12bb458615939ea95f93c713b974f2d4441a9b35d5c7ea0e0917c8563caea1f2","observation_id":"476c1df0-c9b8-43a1-ba13-518b7294a8ab","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:58.232585Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:f95c5fceb28657c632dd71246f0ce44a832c59523af9d669c03851a166f60fd7","observation_id":"a36559ad-8a7a-46a8-9299-77092c1d3db8","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.17565","last_updated":"2026-06-26T02:04:58Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T18:11:08Z","title":"UniGeo: Unifying Geometric Guidance for Camera-Controllable Image Editing via Video Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-05T16:47:32.853010Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.17565"},"observation_digest":"sha256:3c359ae8873681fc89f42c29e31ad1648c6a5dca68317624c62098fdaad871aa","observation_id":"9510abdc-f1c1-4fae-86d0-b88035f03019","resolution":{"observed_at":"2026-07-05T16:51:14.240617Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.18564","last_updated":"2026-04-21T06:41:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:52:15Z","title":"MultiWorld: Scalable Multi-Agent Multi-View Video World Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:11.514186Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.18564"},"observation_digest":"sha256:36886734b795688dc824d279fdaf13fb936d552c8007ef8cece1507024f019b8","observation_id":"a1d3144e-8776-4ac3-b493-34198b3f9357","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T03:02:26.084185Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:8c9b223ec3997af39cc625acb8a765f60064ecc1f1c9f1bcc627a15b1b71e993","observation_id":"7d185eac-58e0-45a9-8009-1b1b9f3e4da6","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T06:15:32.881140Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:f4aa2e8c281a0375ab5c8ae223eec38bdbfd9dda2b7d3df8999ef0a92062c1e5","observation_id":"08d65f79-7c4b-4ebf-98d5-bb5732f81ade","resolution":{"observed_at":"2026-05-15T06:19:50.279253Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:14:17.676675Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.19683"},"observation_digest":"sha256:cd9fac1389afebbac33b1a96ab5cf6e17e652b3b7f301593bf7fd87490c5c0a7","observation_id":"cc575329-78a5-4ad9-8af7-fe0ea9cf7c5d","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.21017","last_updated":"2026-06-04T17:26:29Z","snapshot_observed_at":"2026-08-03T16:24:19.318353Z","submitted_at":"2026-04-22T19:05:17Z","title":"Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T23:53:09.614994Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.21017"},"observation_digest":"sha256:dd27f0119798d2e5e3645d11a296c60ab107d47c216f3d2842e069e1614e077a","observation_id":"e736b80b-c559-45cf-96f9-f4ffd6c23873","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.21741","last_updated":"2026-05-05T16:01:35Z","snapshot_observed_at":"2026-07-29T22:30:00.899443Z","submitted_at":"2026-04-23T14:42:54Z","title":"Hi-WM: Human-in-the-World-Model for Scalable Robot Post-Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T21:26:26.540403Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.21741"},"observation_digest":"sha256:2b7d3cb56a4c4278c2f1c6ad709565888d0ca1009af962ad720515a745aba7b0","observation_id":"4e5f7877-17c3-4ec6-a432-db1e23b5cccf","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2604.28185","last_updated":"2026-04-30T17:59:02Z","snapshot_observed_at":"2026-07-06T23:13:29.310140Z","submitted_at":"2026-04-30T17:59:02Z","title":"Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T06:38:04.459129Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2604.28185"},"observation_digest":"sha256:1fcff2f56430abb710211f660c10a127cabd4cc04666fb907907c766aae93c08","observation_id":"b0566a21-f8cf-4eff-9d9e-a1eba39f51b7","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.00050","last_updated":"2026-04-29T14:33:27Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-29T14:33:27Z","title":"Learning physically grounded traffic accident reconstruction from public accident reports","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-09T19:59:27.929899Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.00050"},"observation_digest":"sha256:99144cd2fd1581568a1d14fd15b2d91d0581c906f81d1b9dcf2e77bb22591575","observation_id":"34795d18-378b-4dc0-aa2b-d1cebad163ee","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.00080","last_updated":"2026-04-30T14:35:31Z","snapshot_observed_at":"2026-08-04T20:02:32.182599Z","submitted_at":"2026-04-30T14:35:31Z","title":"World Model for Robot Learning: A Comprehensive Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T20:38:12.709629Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.00080"},"observation_digest":"sha256:1cb93afe48fb6b861f94ea15e13164777ab31b8b13856d93942399fd5dcf0aea","observation_id":"53bbaa4a-b583-462f-9ea3-f96b48cdd36e","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.02757","last_updated":"2026-05-04T15:57:07Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T15:57:07Z","title":"Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T18:21:00.089755Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.02757"},"observation_digest":"sha256:5084c94c3af79bb6a0cf52c3f1a0f9e14b495f2accc9aa643c345ab639e063c7","observation_id":"096cd1c8-87f2-4264-806f-9488893c8fc6","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:06:10.595164Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:c19469b6d4cf2d8e0840838d4ab69d043ef0afa3ce028cedd821535b6b897af9","observation_id":"530c4c0e-acb4-45b7-a087-145d7c9c3d87","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T19:02:19.756092Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.03269"},"observation_digest":"sha256:b87350a94d86033b0b718206ff904cdc269ba60d650c06725a2fca4e3d956d5c","observation_id":"3014a16a-ab53-4b04-ae5b-40792c4d8723","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.07514","last_updated":"2026-05-08T09:44:43Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:44:43Z","title":"Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:31:30.530595Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.07514"},"observation_digest":"sha256:a4091b03602182a0cb62a5dad59abcf25820a6e846fdabba6617a037b448d6d8","observation_id":"9fb38d36-dac3-47be-8b49-1d3c523199e9","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.08735","last_updated":"2026-05-09T06:39:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T06:39:17Z","title":"CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T02:17:30.227755Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.08735"},"observation_digest":"sha256:95a6ec42509fbd52f3db19dc9c6dae7ec73ca3cce759e7e37989cbbe184a4b9f","observation_id":"c8695a0e-d55a-4eee-ab2c-18803b91979e","resolution":{"observed_at":"2026-05-12T23:01:14.323574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.12334","last_updated":"2026-05-20T07:28:11Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:16:15Z","title":"Reinforcing VLAs in Task-Agnostic World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T04:17:51.349213Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.12334"},"observation_digest":"sha256:a079dd47a9dad579b0c7e6884ced9901f35c61b9989ab781c7348c9ea69ac8c7","observation_id":"a07cccf4-f49a-42f0-af2b-663b6299d52d","resolution":{"observed_at":"2026-05-13T04:27:14.277708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.12334","last_updated":"2026-05-20T07:28:11Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:16:15Z","title":"Reinforcing VLAs in Task-Agnostic World Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T08:13:40.975340Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.12334"},"observation_digest":"sha256:61ab1b324bca855896148ec1edd6c922735f8c17f740319306bb8875246863dc","observation_id":"986f8d80-af33-4be2-8288-fdd7ba5dba9f","resolution":{"observed_at":"2026-05-21T08:14:03.037059Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.13790","last_updated":"2026-05-13T17:11:07Z","snapshot_observed_at":"2026-07-06T23:25:21.032938Z","submitted_at":"2026-05-13T17:11:07Z","title":"Di-BiLPS: Denoising induced Bidirectional Latent-PDE-Solver under Sparse Observations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:06:18.193097Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.13790"},"observation_digest":"sha256:d3a0adb0ce9e135543aacd7b5e2193d6df04e8f2b33971ae292594fed153c537","observation_id":"516c767b-71c5-4c2f-91d5-68956fcce97e","resolution":{"observed_at":"2026-05-14T19:07:50.987224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.14398","last_updated":"2026-05-29T19:42:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:33:41Z","title":"Coding Agent Is Good As World Simulator","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T02:19:49.149075Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.14398"},"observation_digest":"sha256:0847e8614e8ab15e90afbc9c020ec12ccf6eaedff8d904b38a6df5eb94bc4d06","observation_id":"d4c23c5c-4dd4-489f-a9bd-f90ffb6b02f6","resolution":{"observed_at":"2026-05-15T02:23:32.034608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.14398","last_updated":"2026-05-29T19:42:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T05:33:41Z","title":"Coding Agent Is Good As World Simulator","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T20:55:16.040505Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.14398"},"observation_digest":"sha256:5a336d64c3af2accb629993fcf0656277785c69399f882bfaae8da0782031e47","observation_id":"a078f570-9f76-4132-8f15-06ccece8828e","resolution":{"observed_at":"2026-07-01T14:35:46.852607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.15116","last_updated":"2026-05-14T17:29:35Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:29:35Z","title":"DriveCtrl: Conditioned Sim-to-Real Driving Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T21:06:06.548538Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.15116"},"observation_digest":"sha256:76374985ef51be3a99bd9f341c844a4f64294a5216d86e12340370d0bc103df0","observation_id":"b5ed68ce-66e3-44de-8b02-9e582067c172","resolution":{"observed_at":"2026-06-30T21:15:04.787272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.15153","last_updated":"2026-05-21T16:50:35Z","snapshot_observed_at":"2026-08-03T08:09:08.561953Z","submitted_at":"2026-05-14T17:50:42Z","title":"Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T03:15:35.678011Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.15153"},"observation_digest":"sha256:e936ca87df768d2c545a698ab826b26251bbaa213ffbce98e458b5eb9b6fbf29","observation_id":"d91c1c62-87f3-4fc8-a354-8c5c442bcfca","resolution":{"observed_at":"2026-05-15T03:19:44.187738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.15153","last_updated":"2026-05-21T16:50:35Z","snapshot_observed_at":"2026-08-03T08:09:08.561953Z","submitted_at":"2026-05-14T17:50:42Z","title":"Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T09:45:13.742534Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.15153"},"observation_digest":"sha256:6f9beb61f7ea2e2d8b98fd09815a635a509501fe329e871efc2d488505284d6f","observation_id":"173d31fe-008e-4bbe-86ce-73d7b0502d74","resolution":{"observed_at":"2026-05-22T09:46:22.452132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.17077","last_updated":"2026-05-16T16:52:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-16T16:52:08Z","title":"How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T15:18:40.457780Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.17077"},"observation_digest":"sha256:ebd1f642db80c5dc2737748623c60c930b186ac0fff0f43419daef8476fe54b9","observation_id":"425ee546-4408-47c4-bd50-17460cbc0c11","resolution":{"observed_at":"2026-05-20T15:23:25.279166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.17537","last_updated":"2026-05-25T09:18:44Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:42:42Z","title":"Self-supervised Hierarchical Visual Reasoning with World Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T12:41:17.559901Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.17537"},"observation_digest":"sha256:50adc7055765d69c2b4973f3f8d1e74b0156c219973bdba9c9b6ace9f0710821","observation_id":"fa290429-9457-46bb-9934-66c82d90dacd","resolution":{"observed_at":"2026-05-20T12:43:16.866382Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.17537","last_updated":"2026-05-25T09:18:44Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:42:42Z","title":"Self-supervised Hierarchical Visual Reasoning with World Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T19:04:33.433907Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.17537"},"observation_digest":"sha256:7685578e6b72fc3e70d3cee4ed432f4846eafd7e52bc3307df205b1d88ddcb2f","observation_id":"95302fe6-4ace-4927-a355-6ff92b627d65","resolution":{"observed_at":"2026-06-30T19:05:00.273959Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.17912","last_updated":"2026-05-18T06:18:21Z","snapshot_observed_at":"2026-08-02T17:44:18.118027Z","submitted_at":"2026-05-18T06:18:21Z","title":"WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T10:59:54.879907Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.17912"},"observation_digest":"sha256:6a8f1ff4ebb919b907f6f2a461a1b69a0348b2eebccca9ec91d0f1cb6de740be","observation_id":"88a07589-9b1c-4766-8c1e-09818ccd60fa","resolution":{"observed_at":"2026-05-20T11:03:13.688410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.18396","last_updated":"2026-05-19T06:23:43Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T13:42:24Z","title":"NEWTON: Agentic Planning for Physically Grounded Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T10:56:22.343333Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.18396"},"observation_digest":"sha256:b9a53bfe1081ad56c6899c448209a61c0fe7d49b99811dfca7d796de404e0c51","observation_id":"5d7afa79-4545-41d9-832b-d6af11a6f445","resolution":{"observed_at":"2026-05-20T10:58:13.800270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:c046efececc3241336ce400b3ea0391440e3c1c2cc958365d54c31fcae2cee7d","observation_id":"d1e93c55-63b7-496a-bac3-7e435c202e64","resolution":{"observed_at":"2026-05-20T07:33:07.562468Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.19957","last_updated":"2026-05-19T15:10:27Z","snapshot_observed_at":"2026-07-06T23:30:35.042915Z","submitted_at":"2026-05-19T15:10:27Z","title":"World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T06:36:47.265734Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.19957"},"observation_digest":"sha256:95235435670c816b4fc4f73809a8b705f4e2474fdd287b6f0d8779260197b2e4","observation_id":"2d959405-5891-4b63-899e-9b1337ae3a52","resolution":{"observed_at":"2026-05-20T06:38:05.636274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.20624","last_updated":"2026-05-20T02:16:30Z","snapshot_observed_at":"2026-08-04T08:46:12.560576Z","submitted_at":"2026-05-20T02:16:30Z","title":"Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T06:12:31.783615Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.20624"},"observation_digest":"sha256:76d0587204f00e6843fedb28924ebad867fc8086893599bd0297ab7202f929db","observation_id":"9c206a40-a2dd-4020-a16e-0e2c99729dab","resolution":{"observed_at":"2026-05-21T06:13:59.578801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.23699","last_updated":"2026-05-22T14:51:22Z","snapshot_observed_at":"2026-07-06T23:33:53.870540Z","submitted_at":"2026-05-22T14:51:22Z","title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T04:39:22.400458Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.23699"},"observation_digest":"sha256:70ffd86601180e7a2ef956e76d1f2332fb1c10b51ab88040431e6db38d56d32a","observation_id":"1a8f9b0a-1dbb-49ec-a680-f27e3d4dae36","resolution":{"observed_at":"2026-05-25T04:40:23.268359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.27589","last_updated":"2026-05-26T19:02:26Z","snapshot_observed_at":"2026-08-05T09:42:53.562841Z","submitted_at":"2026-05-26T19:02:26Z","title":"What-If World: A Causal Benchmark for General World Models in Embodied Scenarios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:23:22.987086Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.27589"},"observation_digest":"sha256:c691677832b62d221e4a0e9da6af853eb1fe7cb9da36a629e105287e2fb4db57","observation_id":"7cfd86f1-b242-4fd6-92ef-9e9ec2370a0f","resolution":{"observed_at":"2026-06-29T18:23:50.356445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.28230","last_updated":"2026-05-27T09:44:18Z","snapshot_observed_at":"2026-08-02T14:07:06.995097Z","submitted_at":"2026-05-27T09:44:18Z","title":"Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T12:55:24.689338Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.28230"},"observation_digest":"sha256:10b60269f35018a7212c9c535576bcf4ecb8ab6b36a078c88a2932e5a17fe82f","observation_id":"68f05e78-715d-4bcd-a2b8-b9b3a4a8522a","resolution":{"observed_at":"2026-06-29T13:03:26.638052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2605.28816","last_updated":"2026-05-27T17:59:31Z","snapshot_observed_at":"2026-08-05T12:39:49.226899Z","submitted_at":"2026-05-27T17:59:31Z","title":"Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:34:03.020051Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2605.28816"},"observation_digest":"sha256:59c0d5c9798eb82a7135f16ef6d203bc37872094e2554c9a94b1037d793d8e45","observation_id":"2e702759-30b6-42cf-aadf-a3d2d85f50ad","resolution":{"observed_at":"2026-06-29T13:53:29.115357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.00133","last_updated":"2026-05-28T21:23:24Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-28T21:23:24Z","title":"World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-06-29T08:36:23.776293Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.00133"},"observation_digest":"sha256:c03bd40c966900d89b4cab1bdcc26ce9c45a55916e0646c79ef3196c63b0f6b3","observation_id":"226e4e9c-60ca-4416-9714-e137062acefc","resolution":{"observed_at":"2026-06-29T08:43:15.654464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.00499","last_updated":"2026-05-30T03:13:00Z","snapshot_observed_at":"2026-07-06T23:41:10.825760Z","submitted_at":"2026-05-30T03:13:00Z","title":"OptiWorld: Optimal Control for Video World Generation under Physical Constraints","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T19:02:51.848742Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.00499"},"observation_digest":"sha256:409a96438a4984cd1f0cfea97cfa1dd143ad7c384becd4f5c773c636c91ae6d0","observation_id":"0713b3dc-b9e4-4d64-a9ae-05704cec4938","resolution":{"observed_at":"2026-06-28T19:32:35.509546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.01027","last_updated":"2026-05-31T05:35:36Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:35:36Z","title":"$\\tau_0$-WM: A Unified Video-Action World Model for Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T17:21:06.079898Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.01027"},"observation_digest":"sha256:fb0bffb021766359f1076383fd9fef5d42c8bc8ef0ae42700b30e828a4fa3783","observation_id":"49d26b9e-d761-4967-be0f-f5593d6b32d7","resolution":{"observed_at":"2026-06-28T17:22:24.504637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.01095","last_updated":"2026-05-31T08:35:12Z","snapshot_observed_at":"2026-07-06T23:41:43.820102Z","submitted_at":"2026-05-31T08:35:12Z","title":"Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T17:21:15.500408Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.01095"},"observation_digest":"sha256:876c36ca651f815d99fdfbd9b37c60edc1ae580055693fcf7e88f7fc9977e94e","observation_id":"ee9ffe6e-34bc-44e0-994b-e200ff4a3f33","resolution":{"observed_at":"2026-06-28T17:22:24.413659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.02274","last_updated":"2026-06-06T05:27:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T14:01:11Z","title":"Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T14:41:50.084254Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.02274"},"observation_digest":"sha256:30cebabd6778e2fb56a35f616b9b4edda55806e2e60b13da26962091d65afb7c","observation_id":"0866c75f-eb61-44fb-a5c6-f73e10f09d6a","resolution":{"observed_at":"2026-07-01T23:06:20.428785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.02577","last_updated":"2026-06-01T17:59:38Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:59:38Z","title":"RoboDream: Compositional World Models for Scalable Robot Data Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T14:07:31.809341Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.02577"},"observation_digest":"sha256:3bdc425c7d153e6faac97442f712fb2ae9751e593ffa9b465f475657adf550d2","observation_id":"47e0ba62-cfe3-4f77-8281-3863146feb2d","resolution":{"observed_at":"2026-07-01T23:36:23.584650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.03159","last_updated":"2026-07-23T22:35:14Z","snapshot_observed_at":"2026-08-02T12:34:11.019179Z","submitted_at":"2026-06-02T05:11:05Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T11:11:46.428727Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.03159"},"observation_digest":"sha256:435fc0da82be00ea50229e3c4f82dac6ed92c6302278a770a6ea4c63610edb86","observation_id":"b294cd98-cc39-4856-941a-61a9052f498e","resolution":{"observed_at":"2026-07-02T02:06:27.451431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-02T12:34:17.389528Z","title":"World simulation with video foundation models for physical ai.arXiv preprint arXiv:2511.00062,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03159","last_updated":"2026-07-23T22:35:14Z","snapshot_observed_at":"2026-08-02T12:34:11.019179Z","submitted_at":"2026-06-02T05:11:05Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T12:34:17.389528Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.03159"},"observation_digest":"sha256:885476c34df78da65fb5795819b0afaed0d82ad449fbaf40da38f41bc8281e87","observation_id":"ba28d442-6e81-405f-8219-aa41da504410","resolution":{"observed_at":"2026-08-02T12:34:17.389528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.03943","last_updated":"2026-06-02T17:30:50Z","snapshot_observed_at":"2026-08-04T20:12:09.441666Z","submitted_at":"2026-06-02T17:30:50Z","title":"PointAction: 3D Points as Universal Action Representations for Robot Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T10:09:48.280446Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.03943"},"observation_digest":"sha256:d844e3be20f06c50153c80d92c12b03948723d61056b02a9faebc96cad217dd3","observation_id":"1177adce-4513-4cb5-997f-ef3e4beaeebd","resolution":{"observed_at":"2026-07-02T03:16:34.866751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.04463","last_updated":"2026-06-04T13:11:48Z","snapshot_observed_at":"2026-08-02T11:02:18.016581Z","submitted_at":"2026-06-03T05:16:41Z","title":"OSCAR: Omni-Embodiment Action-Conditioned World Model for Robotics","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T06:35:26.480518Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.04463"},"observation_digest":"sha256:8665c6b23311921a14bc7cc6050b12fb19a109568a03639cae1a26d95124344e","observation_id":"b7c62be3-a5c4-4a6c-a8f0-2cfdb861045b","resolution":{"observed_at":"2026-07-02T07:56:47.049610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.08737","last_updated":"2026-06-07T17:18:23Z","snapshot_observed_at":"2026-08-05T06:09:09.261687Z","submitted_at":"2026-06-07T17:18:23Z","title":"Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T18:17:06.288698Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.08737"},"observation_digest":"sha256:b7879ebcf547061c31611d1a3821bdc7320c9a4a60e6f64e1ace336be5f0ab8c","observation_id":"5a214f1b-b761-493a-8343-d66e691ec6f6","resolution":{"observed_at":"2026-07-02T23:27:26.854388Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09215","last_updated":"2026-06-08T08:50:14Z","snapshot_observed_at":"2026-08-05T23:08:42.148456Z","submitted_at":"2026-06-08T08:50:14Z","title":"MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:25.136391Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09215"},"observation_digest":"sha256:baa7c785bb72dedff08296c4d43f575d62a271b806e1e5517587f9ddad28ee1c","observation_id":"26aa952f-0ba2-47d9-ab50-2cacda776694","resolution":{"observed_at":"2026-07-03T01:37:30.721968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09499","last_updated":"2026-06-08T13:50:31Z","snapshot_observed_at":"2026-08-04T01:38:32.249378Z","submitted_at":"2026-06-08T13:50:31Z","title":"Targeting World Models to Compromise Robot Learning Pipelines","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T16:05:01.264700Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09499"},"observation_digest":"sha256:e543865705fcf8d927cee83ff46ad5259725a5bc28c7ae2586c8acfa8d39a834","observation_id":"b27474e3-af7a-4011-9ae8-ecbb0a44072b","resolution":{"observed_at":"2026-06-27T16:41:03.690648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09507","last_updated":"2026-06-08T13:59:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T13:59:50Z","title":"Prisma-World: Camera-Controllable Multi-Agent Video World Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T17:03:29.676482Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09507"},"observation_digest":"sha256:3f43c195cb351ccc0a0d2a872a3e310ce0d7d9f0eb608d4aa964224ebc164544","observation_id":"8485be8d-3234-48c7-9d2e-6114cd9a9e1a","resolution":{"observed_at":"2026-07-03T00:47:30.157870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09803","last_updated":"2026-06-08T17:54:10Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-08T17:54:10Z","title":"Echo-Memory: A Controlled Study of Memory in Action World Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:58:37.552036Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09803"},"observation_digest":"sha256:a2f5f90314c3beec5092d153e0b4c0cf7237e798b985604458f371b6fdce1def","observation_id":"e6590b4a-8ccb-4bc7-bf74-c81556e78738","resolution":{"observed_at":"2026-07-03T00:57:29.762501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.09827","last_updated":"2026-06-08T17:59:53Z","snapshot_observed_at":"2026-08-02T03:40:52.111546Z","submitted_at":"2026-06-08T17:59:53Z","title":"MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T16:13:19.238535Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.09827"},"observation_digest":"sha256:203b613de34d96d90828522de8f9651a1e84e7c085ff4ddcb8e84d320dbb2aa2","observation_id":"decda045-f23d-4377-8905-fc6f7ecfd57a","resolution":{"observed_at":"2026-07-03T01:57:32.223652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.10276","last_updated":"2026-06-09T00:50:29Z","snapshot_observed_at":"2026-07-06T23:49:32.647742Z","submitted_at":"2026-06-09T00:50:29Z","title":"Hierarchical Policies from Verbal and Egocentric Human Signals for Natural Human-Robot Interaction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:02.640975Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.10276"},"observation_digest":"sha256:4afef153a0894bff1595bdd46e0d5fc8e96f66e0f51ff9d977fc9604a699af33","observation_id":"8e9fe27f-cdae-47c3-a8db-356965475274","resolution":{"observed_at":"2026-07-03T04:57:38.603718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.10656","last_updated":"2026-06-09T10:04:38Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T10:04:38Z","title":"Envision4D: Envisioning Visual Futures via Feed-forward 4D Gaussian Splatting for Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T13:48:15.379724Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.10656"},"observation_digest":"sha256:01e19358e0e22d16a293f69e42027acf0b2365de62eb503056633cbf584b996b","observation_id":"bb4167c1-d3f8-43e7-8d01-f4cdd868012f","resolution":{"observed_at":"2026-07-03T04:37:36.898884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.11129","last_updated":"2026-06-23T05:28:32Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:24:36Z","title":"WorldOlympiad: Can Your World Model Survive a Triathlon?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:05:26.397711Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.11129"},"observation_digest":"sha256:722f85aa14e165d291986e2e4b425f57883abd489c1daa8baef41080c04faf2c","observation_id":"7e5f1ff1-3baf-4992-b0b3-3dc0fbbafba8","resolution":{"observed_at":"2026-07-03T05:47:41.258522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.12403","last_updated":"2026-06-10T17:59:08Z","snapshot_observed_at":"2026-08-01T17:35:24.729614Z","submitted_at":"2026-06-10T17:59:08Z","title":"World Pilot: Steering Vision-Language-Action Models with World-Action Priors","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:02.137152Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.12403"},"observation_digest":"sha256:e0c839876696f442aa539819868f10e198440ff20ba29016cb9a32411e3f0995","observation_id":"db0b85f4-8434-45ba-a162-ce39c96f6224","resolution":{"observed_at":"2026-07-03T11:18:03.367479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.13674","last_updated":"2026-06-11T17:59:43Z","snapshot_observed_at":"2026-08-05T10:29:17.827399Z","submitted_at":"2026-06-11T17:59:43Z","title":"RepWAM: World Action Modeling with Representation Visual-Action Tokenizers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T06:47:05.236028Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.13674"},"observation_digest":"sha256:2b1737c70eac4661db2e5e45664987e032fe6265be920680bb84aafb507169e5","observation_id":"f712b579-d06a-42cb-a67e-fab5be5b2317","resolution":{"observed_at":"2026-07-03T14:58:33.402657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.16776","last_updated":"2026-06-28T12:48:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-15T14:21:35Z","title":"JoyAI-Sim: A Simulation-Enabled Interconversion Toolchain for the Embodied Data Pyramid","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T10:31:54.292897Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.16776"},"observation_digest":"sha256:f1181fc3a04f83a978ea08a78e4e2303509a8819d4123741d5a7d85f2f626259","observation_id":"07740f9e-264d-4bb3-9d19-d02040054ca3","resolution":{"observed_at":"2026-06-30T10:34:36.285000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.16917","last_updated":"2026-06-20T01:31:21Z","snapshot_observed_at":"2026-08-01T07:32:26.648643Z","submitted_at":"2026-06-15T16:23:42Z","title":"Unified Motion-Action Modeling for Heterogeneous Robot Learning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T04:09:06.885372Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.16917"},"observation_digest":"sha256:47b76a946caf699fb6e4b888baeaa258488a0f0a53cfe7e5ff1c6af753a6ee4f","observation_id":"ea456dda-ca92-4b09-b322-d91e83309386","resolution":{"observed_at":"2026-07-03T17:28:44.450366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18375","last_updated":"2026-06-23T16:50:09Z","snapshot_observed_at":"2026-08-02T07:17:06.028384Z","submitted_at":"2026-06-16T18:23:23Z","title":"PAIWorld: A 3D-Consistent World Foundation Model for Robotic Manipulation","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T00:19:33.170645Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18375"},"observation_digest":"sha256:b2ed9b1205f5ddbee5dc3c47aeaded36203aed7b5ccf52158a123fa68bdcf873","observation_id":"a0374d14-7131-4951-9926-ab50da5b3f6f","resolution":{"observed_at":"2026-07-03T21:38:58.746884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18478","last_updated":"2026-06-23T08:04:55Z","snapshot_observed_at":"2026-08-05T20:33:40.212920Z","submitted_at":"2026-06-16T20:38:30Z","title":"Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T00:55:20.691480Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18478"},"observation_digest":"sha256:d2ac4611596dda9f0db740f45ea49ab01ce0a553f2f4f770c5ad639ce753736e","observation_id":"53cf68d8-2acc-4d4f-96d2-9a873d364131","resolution":{"observed_at":"2026-07-03T21:08:58.095744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18610","last_updated":"2026-06-26T17:59:04Z","snapshot_observed_at":"2026-08-02T00:45:02.088790Z","submitted_at":"2026-06-17T02:15:46Z","title":"SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T21:18:07.494794Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18610"},"observation_digest":"sha256:4f96c835d1b70062225a4111ba01501fcb1fb63b6b7594d3f21db7bd71326dda","observation_id":"f2a039eb-731e-4d73-81c0-460d909bde03","resolution":{"observed_at":"2026-07-04T00:19:13.396326Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18610","last_updated":"2026-06-26T17:59:04Z","snapshot_observed_at":"2026-08-02T00:45:02.088790Z","submitted_at":"2026-06-17T02:15:46Z","title":"SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:30.594399Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18610"},"observation_digest":"sha256:e31ac521211c8c1437c6b2e167a24d58de4f8cd8c040f8cb259775c52c30efc8","observation_id":"43ee7b49-2995-4cb3-8038-0041d7dca188","resolution":{"observed_at":"2026-06-29T18:23:51.418723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.18960","last_updated":"2026-06-18T07:33:11Z","snapshot_observed_at":"2026-08-01T14:33:56.926730Z","submitted_at":"2026-06-17T11:42:00Z","title":"Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T21:50:26.223702Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.18960"},"observation_digest":"sha256:1c2c95571a78af8a0db265ddb5406061232cf81d27c3f860ed684201e07aad9f","observation_id":"fd63755f-e389-441f-af67-1969f010d5ae","resolution":{"observed_at":"2026-07-03T23:39:04.851790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.19836","last_updated":"2026-06-18T06:28:33Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T06:28:33Z","title":"World Engine: Towards the Era of Post-Training for Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T17:21:15.456982Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.19836"},"observation_digest":"sha256:68567a50f9b5fdfa7ef0929b95e8b9909670d79a7fa4635ad679348925f3c575","observation_id":"0186237b-8460-4fd2-ac03-af8946a85dba","resolution":{"observed_at":"2026-07-04T03:59:33.870765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.20867","last_updated":"2026-06-18T18:54:51Z","snapshot_observed_at":"2026-08-03T13:52:03.831619Z","submitted_at":"2026-06-18T18:54:51Z","title":"FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:08.616612Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.20867"},"observation_digest":"sha256:571d21875b7e8f5a3313fa4d177928e702035e895dc99c810bea7c21e2f03179","observation_id":"143010e0-b851-4b85-8b31-7d2f1e0053cc","resolution":{"observed_at":"2026-07-04T03:29:30.391838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.23085","last_updated":"2026-06-22T09:32:28Z","snapshot_observed_at":"2026-08-05T05:46:25.463258Z","submitted_at":"2026-06-22T09:32:28Z","title":"Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T08:43:06.983870Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.23085"},"observation_digest":"sha256:adbe6c11111d55292f8889246ad499b02beeedefbe9a300866f7fd94bee2ca28","observation_id":"f6cfe78c-ec3b-4456-92f7-a7984f1a9b44","resolution":{"observed_at":"2026-07-04T10:39:44.765169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.24597","last_updated":"2026-06-23T13:53:55Z","snapshot_observed_at":"2026-07-06T23:59:08.580746Z","submitted_at":"2026-06-23T13:53:55Z","title":"Qwen-AgentWorld: Language World Models for General Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:31.403419Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.24597"},"observation_digest":"sha256:b2709367744e0c1c387c13c8134d160f8f7805e88c86e3a7f9da14a5cbb9da9a","observation_id":"c884a9f7-45c6-4d56-a02b-b543c1a27859","resolution":{"observed_at":"2026-07-04T17:09:59.232510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.25306","last_updated":"2026-06-24T02:12:54Z","snapshot_observed_at":"2026-07-06T23:59:47.542695Z","submitted_at":"2026-06-24T02:12:54Z","title":"Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T21:33:38.643889Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.25306"},"observation_digest":"sha256:54dc8889bfa1ce96ad434b86072bd4d6151db0c0b17e6647c2e3be40a5be5479","observation_id":"345b4521-a0b1-4df9-9d05-5040bfd2a2a2","resolution":{"observed_at":"2026-07-04T19:20:05.904375Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.25473","last_updated":"2026-06-24T06:58:02Z","snapshot_observed_at":"2026-08-05T22:45:50.916812Z","submitted_at":"2026-06-24T06:58:02Z","title":"Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T20:57:30.765802Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.25473"},"observation_digest":"sha256:11cd59f3fb0516fb94d4ef10bebca7ef84ab49d96086f341786d3b23e0b13810","observation_id":"2e214b17-4e5c-4ee0-8ac1-1fa7967f7900","resolution":{"observed_at":"2026-07-04T19:50:11.367469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":"2511.00062","doi":"10.48550/arxiv.2511.00062","metadata_source":"pith","pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Simulation with Video Foundation Models for Physical AI","venue":"cs.CV","work_id":"1dc393b8-98c3-43bd-8ab0-25d7c2a9705b","year":2025},"citing_paper":{"arxiv_id":"2606.27325","last_updated":"2026-06-25T17:36:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-25T17:36:35Z","title":"Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T05:23:07.046527Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2606.27325"},"observation_digest":"sha256:59d8788c40e752baaa3fec7b8ebf4c66c0ba723e1a20b09281abfb96089d21e1","observation_id":"b0d95287-a3c6-4785-a94c-83f36ee7c640","resolution":{"observed_at":"2026-07-04T13:19:50.401100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.00062/citation-record","integrity":"/paper/2511.00062/integrity","json":"/paper/2511.00062/citation-record.json","paper":"/paper/2511.00062"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c6f4f55e9763d982ee21b6a2c4204bbd448131db71783d4db06ae11a8de6f3c1","observation_id":"ab3cb743-68a0-4ace-b948-d3a1d9d89180","resolution":{"observed_at":"2026-05-12T23:01:13.764797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07126","last_updated":"2024-11-11T16:58:31Z","snapshot_observed_at":"2026-07-06T19:48:32.368124Z","submitted_at":"2024-11-11T16:58:31Z","title":"Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models","version":1},"cited_work":{"arxiv_id":"2411.07126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07126","snapshot_observed_at":"2026-07-03T00:47:30.400558Z","title":"Edify image: High-quality image generation with pixel space laplacian diffusion models","venue":null,"work_id":"e07c55c7-533e-4182-9a44-b5440d29a1f4","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2411.07126","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8143cf5ab17332e71093ccaf079f66aa9247fbedcabd7e525dfeb9a9edc229e6","observation_id":"412f4703-524d-4c24-8067-82cce219e50b","resolution":{"observed_at":"2026-05-12T23:01:13.610147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recammaster: Camera-controlled generative rendering from a single video","venue":null,"work_id":"076c0ed8-f450-40bf-b786-ad44de304ce4","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:0208206a4df5871b055c7113b6b98a2036a3713ea58ccb4ae8c2b8064e3baf3e","observation_id":"8d4e97d9-0307-45a8-9a93-615803083ce8","resolution":{"observed_at":"2026-05-12T23:01:14.114818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Syncammaster: Synchronizing multi-camera video generation from diverse viewpoints","venue":null,"work_id":"fcb2c846-859e-4a19-9871-1d6a96f68bcf","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:1e616cdcd52dae6499768aa23c1cb6f72b45446c7bfba4889404e3989502106c","observation_id":"05cfa97a-37d4-47f8-a963-f576c59a03bb","resolution":{"observed_at":"2026-05-12T23:01:14.080265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c24dce0b1b8c5da035035cae9351be36b944af28e0acd20596618cae599907ad","observation_id":"8ad112cd-35b9-4b7d-9eab-055948c21a6f","resolution":{"observed_at":"2026-05-12T23:01:13.900179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genie 3: A new frontier for world models","venue":null,"work_id":"5a803ce9-58b1-4758-8505-3a00eb7bd924","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:cce027b992578540b9e7f42c081667eab721daecce988796cef616d06fe529ad","observation_id":"8c71e354-e252-43f9-8c9c-d59d67da6b9d","resolution":{"observed_at":"2026-05-12T23:01:14.090308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":"2406.03520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-07-07T15:43:53.689981Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","venue":"cs.CV","work_id":"27ed795c-abbe-4de1-9a7a-2ecf39c354f3","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:afd2fc0b3f57869d22a11bc0260c23531e012f22f05f3310fb1a7fbc5cb885db","observation_id":"c17a0f9c-3cfe-4b8b-a98d-f1dec6f899ab","resolution":{"observed_at":"2026-05-20T11:34:37.994076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06800","last_updated":"2025-03-09T22:49:12Z","snapshot_observed_at":"2026-08-04T19:41:18.206234Z","submitted_at":"2025-03-09T22:49:12Z","title":"VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation","version":1},"cited_work":{"arxiv_id":"2503.06800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06800","snapshot_observed_at":"2026-07-04T13:19:51.020711Z","title":"Videophy-2: A challenging action-centric physical commonsense evaluation in video generation","venue":null,"work_id":"4dfe3980-dfd5-4917-95e9-179c29e4eb18","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.06800","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8a4e103c8e13a13ab686cd3f5af3bac1f4349cbb1dc62febe132bb1878b41aa5","observation_id":"feea1a15-9db2-4ab4-8253-1d0e571742b9","resolution":{"observed_at":"2026-05-12T23:01:13.918325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:d75aa93ad26a4b34ef490cdd2cb739a202a68ccd5cf59bd556d7992dfc1df88f","observation_id":"8b76e304-375e-4841-a6bc-bf9387a2be39","resolution":{"observed_at":"2026-05-12T23:01:13.924336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"08f855be-6874-4841-9904-e5951484b5c5","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:ac336b8de23d38cdc1c408627feba1cc391e0534534aea53a373a99a78e7a061","observation_id":"87aa9c59-6556-4152-a084-af0d4e6de054","resolution":{"observed_at":"2026-05-12T23:01:14.108994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09849","last_updated":"2025-06-11T15:21:16Z","snapshot_observed_at":"2026-08-05T11:11:08.070103Z","submitted_at":"2025-06-11T15:21:16Z","title":"IntPhys 2: Benchmarking Intuitive Physics Understanding In Complex Synthetic Environments","version":1},"cited_work":{"arxiv_id":"2506.09849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09849","snapshot_observed_at":"2026-07-04T13:59:51.797306Z","title":"Intphys 2: Benchmarking intuitive physics understanding in complex synthetic environments","venue":null,"work_id":"6a27c357-5d91-401c-a3ad-3d9afc4b6f93","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.09849","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:7191521537351a8d5e50212dac3f46693980e5c5484d5ce18d1f1bffa8ebd5bc","observation_id":"d5e3258f-1975-43a1-a456-a2d2404812eb","resolution":{"observed_at":"2026-05-12T23:01:13.930429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":"8e18ab1c-eef4-4b38-8997-f1e406b3c669","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:761d38cc19be871ec4d596d6ceabbe7e9b044e3c9f4369ea8f9041655ff74249","observation_id":"be046de4-45a5-4780-8d99-c997383fe7c2","resolution":{"observed_at":"2026-05-12T23:01:14.120244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02722","last_updated":"2025-09-06T21:02:02Z","snapshot_observed_at":"2026-08-05T11:33:05.834829Z","submitted_at":"2025-09-02T18:18:57Z","title":"Planning with Reasoning using Vision Language World Model","version":2},"cited_work":{"arxiv_id":"2509.02722","doi":"10.48550/arxiv.2509.02722","metadata_source":"pith","pith_arxiv_id":"2509.02722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Planning with reasoning using vision language world model","venue":"cs.AI","work_id":"d7796b30-bd03-428f-8b12-48656aa8122d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2509.02722","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:4d085f7f73f737a94e6437da333a0d916b1f0fcfa38780b6bf65d68db4ba3ff5","observation_id":"78979042-1691-4b31-97a4-7a2df6df84a2","resolution":{"observed_at":"2026-05-12T23:01:13.939379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video depth anything: Consistent depth estimation for super-long videos","venue":null,"work_id":"53a5e6fb-a98b-4a7c-84c1-5fe7305c7b64","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:61f96ddb9191802b795c69d74a34c77d6ba8a0339a4202ba81be90cbbbbc46fb","observation_id":"b4249491-da51-4d0b-938f-825a0180ee23","resolution":{"observed_at":"2026-05-12T23:01:14.130867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10972","last_updated":"2023-05-21T07:07:55Z","snapshot_observed_at":"2026-07-06T14:44:45.326057Z","submitted_at":"2023-01-26T07:37:22Z","title":"On the Importance of Noise Scheduling for Diffusion Models","version":4},"cited_work":{"arxiv_id":"2301.10972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.10972","snapshot_observed_at":"2026-07-07T18:04:00.522746Z","title":"On the importance of noise scheduling for diffu- sion models","venue":"cs.CV","work_id":"1783cbc7-505c-4ebc-82f3-86877ef131b3","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2301.10972","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:4915d9307589447d8de45419870b313bf4fd23902cb8b2c9f4eae8c3e0e3efc9","observation_id":"b2e3c0e0-06c0-4587-9278-38e3d2fc6054","resolution":{"observed_at":"2026-05-12T23:01:13.947275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"eae6459f-9b68-4499-a871-c018c823b169","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:35a7595da1e0f32f7c8c6c460c0c4b26cafe5e51586737b649fb0e4f07bec982","observation_id":"55b562ef-1d13-4b22-996a-c77360e10b06","resolution":{"observed_at":"2026-05-12T23:01:14.152163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delta lake: Open-source storage framework that enables building lakehouses.https: //delta.io/","venue":null,"work_id":"ca99e590-7c1f-4304-a6f4-e9c12f0a962f","year":2019},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:79e260cf3dd6177d0a2d7153eb9bfb6c2b31becba679c4d6feaaa0a081b90462","observation_id":"9458ccae-8aac-41b5-afea-ceabf2f6645d","resolution":{"observed_at":"2026-05-12T23:01:14.158787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo 3, 5 2025","venue":null,"work_id":"f010392a-c2a5-4304-be0a-f21838da9360","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:1950bda43ddc83bdb543bfd4dd72af653e255e5ee349498a60ec193d9d7742bd","observation_id":"49a52bbf-cba0-4db8-bdb9-078863bdba7e","resolution":{"observed_at":"2026-05-12T23:01:14.163715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.00983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:54.342857Z","title":"Worldscore: A unified evaluation benchmark for world generation","venue":null,"work_id":"ad14fa35-72b1-4530-b01a-6d41cd35888d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:3c72fdd6a0c5ca329096b1ffada49ce3d4240288213e3745a07998a2985b9a0f","observation_id":"c29ec697-2aeb-436e-ade5-3d8d1c0c930d","resolution":{"observed_at":"2026-05-12T23:01:13.954077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"a1cc3423-ef62-40cc-87ee-603d95f695d4","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8b55d4bf6d82327a734c0c83d3b8c9169d1b8239bff1ac370a8a1fbc9a9837f0","observation_id":"29ff6d43-a026-4531-8901-be2947ef9b2f","resolution":{"observed_at":"2026-05-12T23:01:14.176994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01264","last_updated":"2026-04-12T14:54:50Z","snapshot_observed_at":"2026-07-06T21:50:49.929005Z","submitted_at":"2025-07-02T00:45:19Z","title":"LLM-based Realistic Safety-Critical Driving Video Generation","version":2},"cited_work":{"arxiv_id":"2507.01264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01264","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLM-based Realistic Safety-Critical Driving Video Generation","venue":"cs.RO","work_id":"41c6faf7-7a34-407b-ac44-574ec266b047","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2507.01264","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c0da1c61608f786c4f6152ff313bb33a9c9006698f3f37e7b715b382c4ed8de0","observation_id":"3464cb8c-58e6-4fa1-906f-ac882462c28b","resolution":{"observed_at":"2026-05-12T23:01:13.962088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion models and gaussian flow matching: Two sides of the same coin","venue":null,"work_id":"1183fac1-6a1c-42d6-9ee0-6773330322c1","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:7ee8b68249d97d364064a647652ae4f05e3f8f414d57dab9c3f528d8a2d840f4","observation_id":"1f8223a3-7728-4dc5-845a-deb5eb77378a","resolution":{"observed_at":"2026-05-12T23:01:14.195347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:65ea5a11180bf3b7f6bcb76a0279f96127fd6aea012c0513759d20bff7cca9d5","observation_id":"edea4d0f-8dc8-424d-9fcb-f19dc243d1b4","resolution":{"observed_at":"2026-05-12T23:01:13.971409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08430","last_updated":"2021-08-06T03:22:14Z","snapshot_observed_at":"2026-07-06T11:30:06.143581Z","submitted_at":"2021-07-18T12:55:11Z","title":"YOLOX: Exceeding YOLO Series in 2021","version":2},"cited_work":{"arxiv_id":"2107.08430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.08430","snapshot_observed_at":"2026-07-04T19:20:06.601231Z","title":"YOLOX: Exceeding YOLO Series in 2021","venue":"cs.CV","work_id":"112b3cd9-8fe6-49fe-bbaa-90a3f46045c7","year":2021},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2107.08430","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:7ba531d9e596f20e27e53d8d9f6d14d7d8c867517649491fe7a66f059ec543d2","observation_id":"eaa9cbc9-f6d9-4048-9310-6e68115ac020","resolution":{"observed_at":"2026-05-13T10:31:31.716715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:269771e53d440fb469137e0adf7a6382da423fe0e794500410843ea6cb82c58f","observation_id":"3dadca2a-d312-45cb-9b6f-62d0f3855602","resolution":{"observed_at":"2026-05-12T23:01:13.986635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00337","last_updated":"2025-05-01T06:34:55Z","snapshot_observed_at":"2026-07-06T21:17:28.488862Z","submitted_at":"2025-05-01T06:34:55Z","title":"T2VPhysBench: A First-Principles Benchmark for Physical Consistency in Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2505.00337","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00337","snapshot_observed_at":"2026-07-04T13:59:51.792842Z","title":"T 2 V P hys B ench: A first-principles benchmark for physical consistency in text-to-video generation","venue":null,"work_id":"8e0819a9-997f-40ad-9d64-220808cd9d4c","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2505.00337","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:edcb482fbfbb486a3c3f5ccdb4f1c671862f605c6382801fa09509fd9f191d60","observation_id":"8dc1b711-ac24-4cf6-b365-8735ce972af6","resolution":{"observed_at":"2026-05-12T23:01:13.994170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:45a51dbc90f9cf8a7a1e353407106bb7daf4e3698a22fa24f934a7239e5c4cf9","observation_id":"f99882ba-cb42-46ea-9153-109dca9c5367","resolution":{"observed_at":"2026-05-12T23:01:14.002924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a23761d30130804d342630358a5374ca705879f21866eb638da22537b8f92e5d","observation_id":"906f848f-38b0-44f0-99bf-c1808cfbddd3","resolution":{"observed_at":"2026-05-12T23:01:14.011752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-03T15:20:23.515607Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":"1912.01603","doi":"10.48550/arxiv.1912.01603","metadata_source":"pith","pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","venue":"cs.LG","work_id":"5103f4be-344a-4139-8504-eaa59f5bac9d","year":2019},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:cb41c9ae0847e8d4c38ef9f1f731162dec05b45babbd1882a790cb496edd0a06","observation_id":"4a1f96cd-9daa-47a3-b344-64bcabdb5e9f","resolution":{"observed_at":"2026-05-12T23:01:14.018849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16922","last_updated":"2025-04-23T17:49:53Z","snapshot_observed_at":"2026-08-01T16:06:16.614739Z","submitted_at":"2025-04-23T17:49:53Z","title":"Generalized Neighborhood Attention: Multi-dimensional Sparse Attention at the Speed of Light","version":1},"cited_work":{"arxiv_id":"2504.16922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16922","snapshot_observed_at":"2026-06-28T22:32:44.088180Z","title":"Generalized neighborhood attention: Multi-dimensional sparse attention at the speed of light","venue":null,"work_id":"80ac4f09-67cb-4ef2-b433-8867df8e43b6","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2504.16922","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:339f42355d597aac7e51740da5e74947410190c4684595f3667757fd5c1cc475","observation_id":"aa7ef977-8a45-4454-abc7-f06974e97305","resolution":{"observed_at":"2026-05-12T23:01:14.026420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15673","last_updated":"2025-06-18T17:56:45Z","snapshot_observed_at":"2026-08-04T10:50:36.114534Z","submitted_at":"2025-06-18T17:56:45Z","title":"UniRelight: Learning Joint Decomposition and Synthesis for Video Relighting","version":1},"cited_work":{"arxiv_id":"2506.15673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15673","snapshot_observed_at":"2026-07-04T13:09:50.468291Z","title":"arXiv preprint arXiv:2506.15673 , year=","venue":null,"work_id":"eb06501a-2d45-43ae-994e-95e15886779e","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.15673","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:5c17967eb922ae152a3881c467eb598bf758dc4c71a2ed062ffbee1a26ee425b","observation_id":"1aac1657-8923-4a1e-9f87-cc03d0c41c31","resolution":{"observed_at":"2026-05-12T23:01:14.035929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"simple diffusion: End-to-end diffusion for high resolution images","venue":null,"work_id":"7f92bfbe-a72f-4f7f-a8c1-c75dca2a6681","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b11ff684f3c97d58c8cefb4b5ea2bcaf988ba6ec32ec813d4d4a88ad550965b4","observation_id":"cd329c03-ce76-45d0-9f9d-4782b071fd88","resolution":{"observed_at":"2026-05-12T23:01:14.264196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-07-06T22:13:09.586800Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"cited_work":{"arxiv_id":"2508.10934","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.10934","snapshot_observed_at":"2026-07-04T13:29:51.199853Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","venue":"cs.CV","work_id":"2d60e542-3c1c-4656-becc-ded522856631","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.10934","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c083a27177be0fb7aa07deabf808c5e51bfca69aa75ef317b8da9b7f8b29c00f","observation_id":"f9dcd7e3-e2e4-4e43-8037-dba17d16ab2d","resolution":{"observed_at":"2026-05-16T16:41:08.910540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07705","last_updated":"2024-05-03T19:00:47Z","snapshot_observed_at":"2026-07-06T13:21:17.244944Z","submitted_at":"2022-06-15T17:57:41Z","title":"LET-3D-AP: Longitudinal Error Tolerant 3D Average Precision for Camera-Only 3D Detection","version":2},"cited_work":{"arxiv_id":"2206.07705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.07705","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let- 3d-ap: Longitudinal error tolerant 3d average precision for camera-only 3d detection","venue":null,"work_id":"533225e8-40c3-463d-a3d9-5171e9b4ad1e","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2206.07705","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:f719a55d1eb041386c6310c298ebf7ece6ebdcfc991f07190c10bd2cf73bc723","observation_id":"3842889c-98aa-432d-93c6-397d01e3b08f","resolution":{"observed_at":"2026-05-12T23:01:14.050176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a6d7e66d5c737f6a89358442e1eabb61611290b44866db99e3a49f526e7cb9e7","observation_id":"d4e9e9b6-b193-4e97-8800-42732f720e3e","resolution":{"observed_at":"2026-05-12T23:01:14.056202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"cited_work":{"arxiv_id":"2505.12705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12705","snapshot_observed_at":"2026-07-10T12:47:05.582841Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","venue":"cs.RO","work_id":"8f44bbac-2812-4198-83bb-f6c857664a1d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2505.12705","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:2a07339edfde14136073d593c57d6d9b567612803ad6432db17fe86a13832e4d","observation_id":"284aa987-6557-4fc1-aa91-dcc35acd264d","resolution":{"observed_at":"2026-05-15T23:50:45.800685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07399","last_updated":"2023-07-03T03:06:26Z","snapshot_observed_at":"2026-08-03T06:41:22.144754Z","submitted_at":"2023-03-13T18:26:11Z","title":"RTMPose: Real-Time Multi-Person Pose Estimation based on MMPose","version":2},"cited_work":{"arxiv_id":"2303.07399","doi":"10.48550/arxiv.2303.07399","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.07399","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rtmpose: Real-time multi-person pose estimation based on mmpose","venue":"arXiv (Cornell University)","work_id":"faecd514-b825-469e-913e-4715dc3737f2","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2303.07399","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:0de70af36037902f5c7a53b71c28cb9cb0c6138a23e4b63280e2aa7dde60a67d","observation_id":"f0765cd3-e892-4bbe-9d26-fa149d80302a","resolution":{"observed_at":"2026-05-12T23:01:14.070641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elucidating the design space of diffusion-based generative models.NeurIPS","venue":null,"work_id":"0640b49e-fbce-4909-a5c8-34a4c2e1ec83","year":2022},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b5d3283252427b5953b97fd72d61b5724906f10a1f7ce97e8da71bcb60081dda","observation_id":"6dd5d3a1-74ef-486c-b209-98da15fff0a2","resolution":{"observed_at":"2026-05-12T23:01:14.304402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:3a2874c1a3a80e7513875ae7e7c0155a70415f3c7f54dfc8dffb8fbcb8cde65e","observation_id":"3537471d-bbb2-4c45-8296-29eb79762abc","resolution":{"observed_at":"2026-05-12T23:01:14.075355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b59e24ea91e15023c26786a05118a01e166a396ddd167debe09e36607aa66f74","observation_id":"665fad89-9f5f-469c-a9e5-a035537641f5","resolution":{"observed_at":"2026-05-12T23:01:13.624574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling","venue":null,"work_id":"9a20e5b1-dc8e-4495-bde2-7f3c6c7495b2","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b2c79eb662500572a3ab3c70d6b7ed8c8b9e35bb76cc97a14b327466089b4bf4","observation_id":"b29f4ddb-f6b4-498a-9da7-c2e97480c021","resolution":{"observed_at":"2026-05-12T23:01:14.321923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:2dbfd265429a86a8711bf8471c720609bc445b1b4fc873f138a63f57ed043191","observation_id":"f2ee8ce3-f025-44bc-a2cf-8780d356ba4e","resolution":{"observed_at":"2026-05-12T23:01:13.632850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:16:44.719370Z","title":"Won- derplay: Dynamic 3d scene generation from a single image and actions.arXiv preprint arXiv:2505.18151","venue":null,"work_id":"5fc82e3e-ec7c-4c0f-8e8e-245be42bc9cd","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:824c1d977a90e14148d1b5dfa4fc5f8d9baf43b3b518a0dc1b6f7e9d2260b4d1","observation_id":"5b6e1514-92d1-45c1-ada2-7903ddd6408a","resolution":{"observed_at":"2026-05-12T23:01:13.639296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Torchtitan: One-stop pytorch native solution for production ready LLM pretraining","venue":null,"work_id":"028d295a-e1da-4218-97cc-bbacbae5e467","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:74ec84cdeac95297fae81fb9d9b4c3e377b6f1917011ccbd496c6ac08ec59f0f","observation_id":"cbcafa83-5f1e-4391-ab60-06f49959080b","resolution":{"observed_at":"2026-05-12T23:01:14.099057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:f5382bdf61a840810dcf245d1e22e2886f3a5ea9538a7b63c1a988f1c8474147","observation_id":"8dd4a2d0-814a-4cef-b4ad-421c3dd83fff","resolution":{"observed_at":"2026-05-15T21:28:42.077022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:85a6724fbeda4655d416078a2e7b0d33895713e8108915a329b64d6e418767e6","observation_id":"adbef28e-01d6-4b66-b831-e5918f9aadb2","resolution":{"observed_at":"2026-05-12T23:01:13.653660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":"2501.13918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-07-04T13:19:51.115512Z","title":"Improving Video Generation with Human Feedback","venue":"cs.CV","work_id":"cfe4c01d-1cf7-4a00-ba86-06d583ca2cff","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c178cb8ee6345c770bcc318a0d3ab088f52ac551cad5316a1cc36d5528f77402","observation_id":"44d2be4c-486d-448f-9aa2-ea991d47a487","resolution":{"observed_at":"2026-05-13T15:30:03.116566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamicscaler: Seamless and scalable video generation for panoramic scenes","venue":null,"work_id":"c273494c-f325-4031-a5a3-8c378a429f96","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:e9694667b10e7b61c8f7b0e73af18707ea06b6cead5434665ea57c3c6cb4192e","observation_id":"f99bbb63-c9bd-4b33-aa44-b2e411deb33e","resolution":{"observed_at":"2026-05-12T23:01:14.138025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a2c045932456324387baffbfdabd1e2ebfaddedbfa8ae201dd1496c4592de477","observation_id":"08efc4e9-13c8-481a-aca0-8d5367ee7e4b","resolution":{"observed_at":"2026-05-12T23:01:13.667121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11081","last_updated":"2025-03-01T09:52:49Z","snapshot_observed_at":"2026-07-06T19:33:30.263638Z","submitted_at":"2024-10-14T20:43:25Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","version":2},"cited_work":{"arxiv_id":"2410.11081","doi":"10.48550/arxiv.2410.11081","metadata_source":"pith","pith_arxiv_id":"2410.11081","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","venue":"cs.LG","work_id":"1151c0b6-2be7-436c-ab83-843d92dea769","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2410.11081","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a320fa5f3ddce2042705a64646ae3f898d0d557f1cbc825eba2bb7653a6fd43b","observation_id":"fd492237-9055-48ba-a752-7c5e6a233445","resolution":{"observed_at":"2026-05-13T10:26:23.772771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T01:23:52.637926+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T01:23:52.637926+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04583","last_updated":"2023-08-20T13:31:54Z","snapshot_observed_at":"2026-08-02T11:43:50.092313Z","submitted_at":"2023-08-08T21:08:42Z","title":"LATR: 3D Lane Detection from Monocular Images with Transformer","version":2},"cited_work":{"arxiv_id":"2308.04583","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04583","snapshot_observed_at":"2026-07-02T02:06:27.410680Z","title":"Latr: 3d lane detection from monocular images with transformer","venue":null,"work_id":"93c472e8-e769-4490-8149-441232b7649c","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2308.04583","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c9222c77ff029c6cba743c2579efa8e27a52c6d0f7746782b52e2134a63e0c83","observation_id":"ef66dd02-13ac-41d7-9beb-570513e9222e","resolution":{"observed_at":"2026-05-12T23:01:13.682645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hailuo","venue":null,"work_id":"dfcb2817-b34f-4c84-9e43-d7f451185f00","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b95502309266e65649f553ece02741109ac22482f603d8576897be08f08a2c14","observation_id":"e9e99ea9-b2e0-4f61-a539-5affb253ebf9","resolution":{"observed_at":"2026-05-12T23:01:14.206489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":"2501.09038","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-07-07T15:43:53.802817Z","title":"Do generative video models understand physical principles?","venue":"cs.CV","work_id":"d9132ccf-02ed-4700-bf79-4e874794600d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:72a721b9568c669ff1e97edb10871b5e6a59b90d9b9f1371473d710a0e3f8f97","observation_id":"b073b607-1fdc-4a9e-a313-abd9b69fd17e","resolution":{"observed_at":"2026-05-20T12:47:06.031259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":"2406.02523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-07-11T02:27:48.956741Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","venue":"cs.RO","work_id":"11232b35-bd17-402a-9234-951c46015815","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:bba1dd747202e9031bd873c9a7d5d212ffaf2a32acb8c081916e4a1fca030a1a","observation_id":"edf2c7b8-8352-4d53-ba76-1603399fd485","resolution":{"observed_at":"2026-05-12T23:46:30.425882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":"2503.15558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-07-05T11:41:02.557688Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","venue":"cs.AI","work_id":"09215448-e68a-4168-89b7-9d9a83a0e51f","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:bb56e6467a1fac7778cfb5a9f74940ede06527a4401599b9833ee56b89d02ccf","observation_id":"32f39998-bff7-4dce-8971-8a381add6192","resolution":{"observed_at":"2026-05-16T12:47:10.348602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14492","last_updated":"2025-04-01T21:14:20Z","snapshot_observed_at":"2026-07-06T20:54:50.337775Z","submitted_at":"2025-03-18T17:57:54Z","title":"Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control","version":2},"cited_work":{"arxiv_id":"2503.14492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14492","snapshot_observed_at":"2026-07-04T04:09:35.034771Z","title":"arXiv preprint arXiv:2503.14492 (2025)","venue":null,"work_id":"f6758fe8-a1a6-4b00-9094-edba697f4c67","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.14492","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:1b17462a2e7feaec2cb18f0f01b59bf57cd2adc28cb167710c71565a66fc486e","observation_id":"f344ecf1-a33d-49c0-8634-5443f93647f8","resolution":{"observed_at":"2026-05-12T23:01:13.712342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:fac4760bb607814dbe25ff5e78664707d4f6cd012742bff247ad3ca758bce711","observation_id":"6f8d0196-3608-45c3-a9f9-cdf0d070daea","resolution":{"observed_at":"2026-05-12T23:01:13.716640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e1b64f36-98d7-4b56-9018-7024c7bed748","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:52e5c156daec96d4e06bd9d5fa3a2a3abfa08a159c522e83482b5a171ecdc4c0","observation_id":"ba398b82-ef48-45ec-8759-07d233eea72d","resolution":{"observed_at":"2026-05-12T23:01:14.248509Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sora","venue":null,"work_id":"9f34eff5-7a40-403a-ad04-f983457d603b","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:1b9077f9f892e8b9813b5f49d36a65b3e52b5fd265f106d208165842ee6d86d9","observation_id":"89c3a877-9d7f-402b-9b79-fefb1ab37802","resolution":{"observed_at":"2026-05-12T23:01:14.256392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.NeurIPS","venue":null,"work_id":"1387d197-97a7-4078-a987-ba844a834819","year":2022},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8f86df58b5a29c131a625aaaf4daa1e489f7b1f2f86909b0e78b5902d482e90b","observation_id":"2ee28bcd-8222-4143-82a5-fe69c5d9dabd","resolution":{"observed_at":"2026-05-12T23:01:14.269581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.00071","doi":"10.48550/arxiv.2309.00071","metadata_source":"pith","pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","venue":"cs.CL","work_id":"31f454a9-7de2-4696-86f2-9bfa1410f80d","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:998fc31a6dbdf0940e304523137bae90480440bfe510fcc20cd70a72762efd00","observation_id":"19018ce4-6981-4d95-9720-68469fb6f6d1","resolution":{"observed_at":"2026-05-12T23:01:13.721168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:710b7d7cd5c11769a878750af498804b3ad96adaa1299d0d911be41155bcb8b3","observation_id":"74b9026e-75e5-420d-80d1-c74b354abed5","resolution":{"observed_at":"2026-05-12T23:01:13.725884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"54486b12-8397-4460-9618-5cbebb6d5a3d","year":2020},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:0ee33f45875580d3aadab5a5e56668f8d6d8d38cdd0660bac25ed6d4865a26a2","observation_id":"a2727a34-99a7-459f-adef-a336243af3b0","resolution":{"observed_at":"2026-05-12T23:01:14.287690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:f63770f78e580130d5f43327ea5e1ee0530d2329cd7e79115d9d4634845f2e11","observation_id":"66e125d8-e0fc-4ea1-8ee6-072a45efb597","resolution":{"observed_at":"2026-05-12T23:01:13.730843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ren, Justin Lidard, Lars Lien Ankile, Anthony Simeonov, Pulkit Agrawal, Anirudha Majumdar, Benjamin Burchfiel, Hongkai Dai, and Max Simchowitz","venue":null,"work_id":"453a2664-e4b7-49db-8ec4-1dc9f0b99158","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:67acdaea64104e7416fbe0293a7379fe60bf28cb5225efc5db8553668713d119","observation_id":"95d616d7-bd92-46a3-b35c-e77a2a868564","resolution":{"observed_at":"2026-05-12T23:01:14.310856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":"2401.14159","doi":"10.48550/arxiv.2401.14159","metadata_source":"pith","pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","venue":"cs.CV","work_id":"42c46ece-c4e8-4d5e-abae-f8d5b4208995","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:cb5178c1593f19085b3f6f789c019dcd86336cb52cd26fb4a6d203d6eebb5f5d","observation_id":"283d1d9f-ef01-48eb-b6ed-3b806058b365","resolution":{"observed_at":"2026-05-12T23:01:13.736123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09042","last_updated":"2025-06-18T17:37:28Z","snapshot_observed_at":"2026-08-01T23:42:27.412980Z","submitted_at":"2025-06-10T17:58:17Z","title":"Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models","version":3},"cited_work":{"arxiv_id":"2506.09042","doi":"10.48550/arxiv.2506.09042","metadata_source":"pith","pith_arxiv_id":"2506.09042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer","venue":"cs.CV","work_id":"af51168b-8b82-45d2-bf85-e3d07f99492b","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2506.09042","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a54b8b59aeb83cefd1043c2c9cb2f36b1f30333d3e43954813e9aa8d3bd19cde","observation_id":"32c4917d-c431-423f-97c5-4237fd9f6cbc","resolution":{"observed_at":"2026-05-12T23:01:13.741361Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen3c: 3d-informed world-consistent video generation with precise camera control","venue":null,"work_id":"9eed6fd0-4807-434b-aac7-43ce79d9aa52","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c37739b63665a2a3e68a50df4176964fcdcfb61cb4c76dd5a8fbe4b88bac1704","observation_id":"654844e1-d016-48e3-a839-c110ecb5fcc1","resolution":{"observed_at":"2026-05-12T23:01:14.094409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gen 3","venue":null,"work_id":"c13ebf76-e279-45e7-819d-83155772af0f","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:74a06682bc60b96b0c9d055d5642c09d021060de53507459682719532b1ec1b8","observation_id":"26ee39e3-336d-4d1e-b6ec-aeba3a8aa358","resolution":{"observed_at":"2026-05-12T23:01:14.104453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/0146-664x(82)90101-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"very scattered","venue":"Computer Graphics and Image Processing","work_id":"b9c85904-9a0c-457d-a48d-6d0f4b44144e","year":1982},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:136fa1a5b1f18a1abe883b5483acfa0814c25780202187ef585eb5b9ae13b035","observation_id":"769806dc-f5fe-4f9d-be52-832c99f440da","resolution":{"observed_at":"2026-05-12T23:01:13.602107Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:4eda8b585e472683465b0431dfd03a3d8d1bb848ccb98e921f42bbc6582d4e1c","observation_id":"1a43ad0e-d7a0-4a16-ba2f-6fa68d3d1a41","resolution":{"observed_at":"2026-05-12T23:01:13.746628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11280","last_updated":"2023-01-26T18:14:32Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:14:32Z","title":"Text-To-4D Dynamic Scene Generation","version":1},"cited_work":{"arxiv_id":"2301.11280","doi":"10.48550/arxiv.2301.11280","metadata_source":"arxiv_reference","pith_arxiv_id":"2301.11280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text-to-4d dy- namic scene generation","venue":"arXiv (Cornell University)","work_id":"3ce955f0-5e21-404f-92ee-75f84ed8f33d","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2301.11280","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:d4022cf35a24d2a5a9e96377459d563f9f3a447a34406dd6fc31c3f40e5d2dee","observation_id":"43e802b8-64de-4ea1-b362-8ab0529edb7b","resolution":{"observed_at":"2026-05-12T23:01:13.753011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Light field networks: Neural scene representations with single-evaluation rendering.NeurIPS","venue":null,"work_id":"8bba14f9-ade9-4002-bb73-cb447f373857","year":2021},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:bc668c7bf8ea186a4a4345dd2324d90400863361151d2f9d954813fb65b9a36a","observation_id":"fc0617d6-52bd-4021-8f69-a2ccb5acd549","resolution":{"observed_at":"2026-05-12T23:01:14.187667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"aae488e1-4b8d-4e33-98e7-b721da073a2a","year":2021},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:73e14d759b38a405086d9e482fa8d3e0a8d71f8334b60dc6d0af2da6fddab747","observation_id":"6ea03bf2-a2d8-492f-b240-f06edf88a77c","resolution":{"observed_at":"2026-05-12T23:01:14.201259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17274","last_updated":"2023-11-03T17:49:03Z","snapshot_observed_at":"2026-08-01T14:57:47.609127Z","submitted_at":"2023-10-26T09:50:40Z","title":"cuRobo: Parallelized Collision-Free Minimum-Jerk Robot Motion Generation","version":2},"cited_work":{"arxiv_id":"2310.17274","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.17274","snapshot_observed_at":"2026-07-08T22:15:39.350913Z","title":"curobo: Parallelized collision-free minimum-jerk robot motion generation","venue":"cs.RO","work_id":"0b2a749e-5231-4ee8-949b-3d494b57d7c2","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2310.17274","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:68c1c0d79512f0f8427b3effd55ae71cbe261b149c06743ff3f6ea3c66a8cf8c","observation_id":"488ccc1b-86f2-49fb-82ce-e6bfcb82f4a9","resolution":{"observed_at":"2026-05-12T23:01:13.759032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1x technologies | safe humanoids for the home","venue":null,"work_id":"e28289b6-cbec-4523-b498-a9ebd9761cad","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:b2b16f535f8e84dd08bc1797e2c434c31885c34c2b357a80d3fb463b3ab2003a","observation_id":"8833b5d3-c4f8-445d-920f-8debd9cf26b0","resolution":{"observed_at":"2026-05-12T23:01:14.223399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":"e9b2a63e-ecce-4c4d-853f-9aabb179c68b","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c82bcbf6b516d367652180ba60fd7afdabbb4cf4059ef948f628ae2fbfb331c6","observation_id":"2f7c672a-6f2c-446d-a1bd-d7f359c57fe8","resolution":{"observed_at":"2026-05-12T23:01:14.228413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"6c8b8805-9da0-4281-8b81-cde89bf31743","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:17a4a599cf28e6f4981fe44a905b65a3582adcdc777db9d0c51378441ed763b3","observation_id":"944ad03f-8f43-4bcd-b564-08fefcf4f9cb","resolution":{"observed_at":"2026-05-12T23:01:14.233658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:1d27e8ca56aa8c8aa8a73a05d5084f77d7629ebb987659d04476bec14ec558ed","observation_id":"49be7c1a-e43e-48fb-b04d-dd4d4cf4ebe1","resolution":{"observed_at":"2026-05-12T23:01:13.617255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive study of decoder-only llms for text-to-image generation","venue":null,"work_id":"9b4e3959-c264-4723-9b5c-a67b62967596","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:654dc57c4ca634b68e90d34fdaf6e319a8cc409da67d1f93465e7b9557e93d46","observation_id":"99eae887-fd5f-4c07-9951-138dbeff236e","resolution":{"observed_at":"2026-05-12T23:01:14.274833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:56:16.359259Z","title":"Frame in-n-out: Unbounded con- trollable image-to-video generation","venue":null,"work_id":"17422dc7-5bc1-4f22-9a42-63d2304c6a8d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:4e489f1d04e73aa0831a1a1126e26ea5b277ccb4bfac6e612546ad6e2f4566ab","observation_id":"44c15761-9b25-49a0-aa9c-1407d55be937","resolution":{"observed_at":"2026-05-12T23:01:13.770365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":"6246519e-2949-45ae-b4f6-122b360c635d","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:7946526fe6eae0aa42ee262169acca08b358aeed8d14265d6a634eb22595aede","observation_id":"fb2dc8e2-b8b4-43a5-a17b-f3ce4ba162fb","resolution":{"observed_at":"2026-05-12T23:01:14.296587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"c54687a4-d22a-401a-a2d3-1eca5df5786c","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:cda6a2876c9ddad87de460c3b7b3ec6f2ec4de472633b083b7c096c93bfb45d0","observation_id":"866afd17-3d65-4d32-95ae-5ddf1427481f","resolution":{"observed_at":"2026-05-12T23:01:14.315657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07860","last_updated":"2025-04-20T04:48:38Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:23:33Z","title":"Controlling Space and Time with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2407.07860","doi":"10.48550/arxiv.2407.07860","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07860","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Controlling space and time with diffusion models","venue":"arXiv (Cornell University)","work_id":"5594369d-3650-4ab0-96ff-1e83983b2dfc","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2407.07860","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:0ea4f095477edf278ced6395113a95bb809cfad8fa0e84911d74d4debe3be59f","observation_id":"f53d5fe8-576d-4941-9640-12dca55e4056","resolution":{"observed_at":"2026-05-12T23:01:13.776381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"16a3c92f-cf24-4270-882a-9dfa125585f7","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:0ad3869fbffd8a0b7ced53d2737374b3f4c4b970a499bb979ef0f1a85dc6387a","observation_id":"ed7ba837-e571-4f04-b041-a9f4e77c7902","resolution":{"observed_at":"2026-05-12T23:01:14.125708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"e1e01ace-5b41-4a75-854e-0ca579e20b03","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:df9e7987629196de76fdfe7e670648eb81cc5dd42afd5e5de1dda64132a14df4","observation_id":"3bdeaf82-ebd2-456b-8442-0534bb253c71","resolution":{"observed_at":"2026-05-12T23:01:14.169733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2412.13877","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-07-08T02:04:26.240460Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","venue":"cs.RO","work_id":"86320616-05fa-4c08-8bc0-4377e53bdba5","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:fccfb50d16f003f644cbefb42703eb842745c2ab2a9f4b26a897ab9666c09f92","observation_id":"68418d26-aa82-45e3-a780-4df51bc9b894","resolution":{"observed_at":"2026-05-15T22:14:18.432154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ties-merging: Resolving interference when merging models.NeurIPS","venue":null,"work_id":"8acf3664-c851-4ba9-b5e1-8aff8ba488af","year":2023},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:f5ba96ea987abb8b41961ee76a4203d58c701337d88e5385906224b385cccaaf","observation_id":"1c2f1d5a-30c3-4efa-972e-32f679470874","resolution":{"observed_at":"2026-05-12T23:01:14.240424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":"2408.07666","doi":"10.48550/arxiv.2408.07666","metadata_source":"pith","pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","venue":"cs.LG","work_id":"add1bfdb-f9a2-4280-a81e-ae663e81b3e3","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:7f9be82ce26331bedc4619a6d9e8710d35600a425a39b07f7091fbca67ebeae8","observation_id":"51988b6b-b002-4279-ba30-465ed87158a8","resolution":{"observed_at":"2026-05-17T22:16:05.189340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a56f165ec723cac5c18f4b28bbfd118d08d4afc2ecc07b328422073e9dc02479","observation_id":"0c3c7d1d-2359-447e-acd6-b3946edd022e","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:acedbdf535ff5c6dc35ea8fb257642da88d709cb555fcaeb6704f3395eabdec1","observation_id":"74b42442-84f4-46f9-b307-b658f57c8fe1","resolution":{"observed_at":"2026-05-12T23:01:13.799820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:11.415417Z","title":"Data-regularized reinforcement learning for diffusion models at scale","venue":null,"work_id":"ce25045f-5459-416e-916e-0059f467f8fe","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:92b4aa943a1ecc2380277647f27024e17ceebe2dc539c56ff9abc473061d5d22","observation_id":"f5188f6a-8cf5-40e6-b1b3-820765e7236c","resolution":{"observed_at":"2026-05-12T23:01:13.811776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"ccbb2008-431d-496e-92e5-9c3d04d61385","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:71e96dc779d1feda17f694a8d1cdaee3076885834f059dcdb21eadf6e3d62cb3","observation_id":"252b42ad-53b3-4bc5-a695-a07a8dea90ff","resolution":{"observed_at":"2026-05-12T23:01:14.085751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09694","last_updated":"2025-05-18T17:18:18Z","snapshot_observed_at":"2026-07-06T21:24:01.607451Z","submitted_at":"2025-05-14T18:00:19Z","title":"EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models","version":2},"cited_work":{"arxiv_id":"2505.09694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09694","snapshot_observed_at":"2026-07-08T07:14:45.297196Z","title":"Ewmbench: Evaluating scene, motion, and semantic quality in embodied world models","venue":"cs.RO","work_id":"8e5d2b4e-eb49-4d72-aa7b-7c983651aa2e","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2505.09694","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:a3c229f8d26b430b321f1a049a55aaaa176651461e760f8db8efbbf9d12502d7","observation_id":"8af2157c-8527-42e4-97d2-2543d4aba109","resolution":{"observed_at":"2026-05-12T23:01:13.822345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15761","last_updated":"2025-08-26T10:56:04Z","snapshot_observed_at":"2026-08-05T17:45:13.859636Z","submitted_at":"2025-08-21T17:56:10Z","title":"Waver: Wave Your Way to Lifelike Video Generation","version":2},"cited_work":{"arxiv_id":"2508.15761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.15761","snapshot_observed_at":"2026-07-09T03:05:55.272870Z","title":"Waver: Wave your way to lifelike video generation","venue":"cs.CV","work_id":"66ede766-4152-4561-898c-408ed2f76aed","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.15761","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:ee2e89ae33343c72778d39fe2428cac4a111663ec487681a6d858198b404178b","observation_id":"2ec731de-1750-4793-9558-1281b08fe6fe","resolution":{"observed_at":"2026-05-12T23:01:13.834624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02319","last_updated":"2024-11-05T06:08:43Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:45:44Z","title":"GenXD: Generating Any 3D and 4D Scenes","version":2},"cited_work":{"arxiv_id":"2411.02319","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02319","snapshot_observed_at":"2026-07-07T14:33:54.303149Z","title":"Genxd: Generating any 3d and 4d scenes","venue":"cs.CV","work_id":"e8253c41-3568-4ea6-bfb9-0d8e589c07ce","year":2024},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2411.02319","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:88b4692e87b43cae02a834b8a96974f3a18ff1c250935b26dfedba477e03a8d2","observation_id":"e6b72cb2-cb9b-4d0f-ae62-3342d8ab69a7","resolution":{"observed_at":"2026-05-12T23:01:13.848208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02316","last_updated":"2025-07-03T05:01:46Z","snapshot_observed_at":"2026-07-06T21:51:33.687556Z","submitted_at":"2025-07-03T05:01:46Z","title":"Are Synthetic Videos Useful? A Benchmark for Retrieval-Centric Evaluation of Synthetic Videos","version":1},"cited_work":{"arxiv_id":"2507.02316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02316","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are synthetic videos useful? a benchmark for retrieval-centric evaluation of synthetic videos.arXiv preprint arXiv:2507.02316","venue":null,"work_id":"d44f676e-2f71-4922-907f-b985d2695793","year":null},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2507.02316","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:bdd0a34634bda548c8e68db6a6773aa044d82f29f2893ab8c2509d01d52c7f4c","observation_id":"49ce5cb8-f139-4fb8-9c88-1d606b8f9a2b","resolution":{"observed_at":"2026-05-12T23:01:13.858638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08431","last_updated":"2026-05-06T15:49:52Z","snapshot_observed_at":"2026-07-06T22:32:13.055128Z","submitted_at":"2025-10-09T16:45:30Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","version":3},"cited_work":{"arxiv_id":"2510.08431","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08431","snapshot_observed_at":"2026-07-11T01:07:44.823334Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","venue":"cs.CV","work_id":"c4d59581-ef40-441f-937a-e325bff802be","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2510.08431","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:22cf5ec28955e851ef3c574b6d790bd5fb6108a5b9e4c74bbd18196139e6d1e6","observation_id":"333d6195-f51a-44ff-bbea-23e061f4f542","resolution":{"observed_at":"2026-05-12T23:01:13.868632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01989","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:26.226892Z","title":"Unipc: A unified predictor-corrector framework for fast sampling of diffusion models.Advances in Neural Information Processing Systems, 36:49842–49869","venue":null,"work_id":"13626a02-1712-4ec2-968b-44548bb50736","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:c98fdbfb2fa1658ca5b087063d750c0b2c7772d864efb503697afcd63855267f","observation_id":"ba33fbdf-c62f-4392-a184-c2149205d762","resolution":{"observed_at":"2026-05-12T23:01:13.875615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-07-06T22:07:16.776694Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":"2508.02095","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models","venue":null,"work_id":"fd121458-5940-4f1f-8f85-380ea73e3a51","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:19ec2fce35ea5df9a67a7bf2846e9117159dd30e9980b4bd8b3551195175c100","observation_id":"b9d7bddd-8785-4d5c-bb5e-1031eda8cec5","resolution":{"observed_at":"2026-05-12T23:01:13.883037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":1,"unresolved":1,"verified_exact":62,"verified_fuzzy":34},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 100 inbound Pith citation observations for arXiv:2511.00062."}