{"as_of":"2026-08-23T05:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca4d822577a57bfc4b542f731e8d573457a5fb1a1e814011e7dad1fdc1c8ef09","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:18:56.680232Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-18T14:39:59.870039Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2410.05363"},"observation_digest":"sha256:1b191939531f49070adc3c523eb2567b8a6a900f3993404a6f3de562ad07a1bf","observation_id":"7b483306-7af6-44f5-835e-ba7551ce0d30","resolution":{"observed_at":"2026-05-18T14:40:00.063661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-12T10:09:30.725901Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19548","last_updated":"2024-11-29T08:47:46Z","snapshot_observed_at":"2026-08-19T21:57:54.475407Z","submitted_at":"2024-11-29T08:47:46Z","title":"ReconDreamer: Crafting World Models for Driving Scene Reconstruction via Online Restoration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:09:30.725901Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2411.19548"},"observation_digest":"sha256:92374b251a117ea755980cc2a45efa3d3dc384c924bf01b3af719ecac2ee7e5c","observation_id":"ac7c7f15-6ba9-4836-876a-f8447df4dc6a","resolution":{"observed_at":"2026-08-12T10:09:30.725901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-11T22:20:39.157769Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03568","last_updated":"2024-12-04T18:59:05Z","snapshot_observed_at":"2026-08-17T08:30:58.061060Z","submitted_at":"2024-12-04T18:59:05Z","title":"The Matrix: Infinite-Horizon World Generation with Real-Time Moving Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:20:39.157769Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2412.03568"},"observation_digest":"sha256:018fbec064bf72dd3e6e21554cc11c1236ec2c82e8a82185098dbe67e4de4642","observation_id":"962a5730-d94d-4734-b57e-f9a2ef31787c","resolution":{"observed_at":"2026-08-11T22:20:39.157769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-11T17:01:13.472343Z","title":"Xiang, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09551","last_updated":"2024-12-12T18:41:20Z","snapshot_observed_at":"2026-08-18T04:01:02.809700Z","submitted_at":"2024-12-12T18:41:20Z","title":"Video Creation by Demonstration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:01:13.472343Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2412.09551"},"observation_digest":"sha256:8fb1629f2022368065a1b5a0909a35f1375617f9c27eed5e828a3a458d238e40","observation_id":"e0ae0471-6766-4f30-8f08-346828480152","resolution":{"observed_at":"2026-08-11T17:01:13.472343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-11T15:16:34.237524Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11198","last_updated":"2024-12-15T14:21:19Z","snapshot_observed_at":"2026-08-21T10:30:28.746918Z","submitted_at":"2024-12-15T14:21:19Z","title":"GEM: A Generalizable Ego-Vision Multimodal World Model for Fine-Grained Ego-Motion, Object Dynamics, and Scene Composition Control","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T15:16:34.237524Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2412.11198"},"observation_digest":"sha256:50b066bb01d749a47ae230a84f03245f1adf4b36e2a49c7fd71653ed5bab00e7","observation_id":"65c3c2cd-1dbf-4b97-94fb-5428114a0bf2","resolution":{"observed_at":"2026-08-11T15:16:34.237524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-11T13:15:28.621415Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16211","last_updated":"2024-12-17T23:00:42Z","snapshot_observed_at":"2026-08-15T19:50:50.194585Z","submitted_at":"2024-12-17T23:00:42Z","title":"Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T13:15:28.621415Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2412.16211"},"observation_digest":"sha256:71e7f848b2cb6a675c822cb15b4f8b9bef179903aa41dc9c7b3f751ccbaf340e","observation_id":"e469ceb0-d007-4643-a473-d1aa05a2bf22","resolution":{"observed_at":"2026-08-11T13:15:28.621415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-10T18:53:00.214745Z","title":"Available: http://arxiv.org/abs/2406.09455","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-08-10T18:47:01.186615Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T18:53:00.214745Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2501.10928"},"observation_digest":"sha256:60af6daa1f1850e4a880617df1bb4dcdf7d95aa1920afcb09f71e8d2c37059ec","observation_id":"e89fd193-ef81-40be-b17c-8a990536d23d","resolution":{"observed_at":"2026-08-10T18:53:00.214745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-08T17:46:20.681746Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05857","last_updated":"2025-09-11T03:59:01Z","snapshot_observed_at":"2026-08-20T09:57:13.619887Z","submitted_at":"2025-02-09T11:28:57Z","title":"EgoAgent: A Joint Predictive Agent Model in Egocentric Worlds","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T17:46:20.681746Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2502.05857"},"observation_digest":"sha256:dd065a9823e32bb92667b277cf758c0bde90d6f3f558cf340ca01154b0d2610a","observation_id":"5c665601-ce46-486f-9273-81868a7e3fc5","resolution":{"observed_at":"2026-08-08T17:46:20.681746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-08T16:36:00.802081Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-17T12:25:57.382548Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.802081Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:0cd63509a16c7421d96a8502de2c88cf67af69dee41d8405b5dd0e742d62a0da","observation_id":"5f3bfb9b-99d0-41a7-87be-8553a1dfd701","resolution":{"observed_at":"2026-08-08T16:36:00.802081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-08T15:14:22.461361Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07825","last_updated":"2025-02-10T14:49:09Z","snapshot_observed_at":"2026-08-19T11:40:20.954372Z","submitted_at":"2025-02-10T14:49:09Z","title":"Pre-Trained Video Generative Models as World Simulators","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:14:22.461361Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2502.07825"},"observation_digest":"sha256:258790ee64a3b16486fb7788d94bc26d7c7ad0ef9138db9389e068259ecedf5f","observation_id":"fa2a7b8e-940e-45cc-baf2-8041ae8be735","resolution":{"observed_at":"2026-08-08T15:14:22.461361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-08T05:57:41.781154Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08234","last_updated":"2025-02-12T09:21:40Z","snapshot_observed_at":"2026-08-18T10:17:33.434999Z","submitted_at":"2025-02-12T09:21:40Z","title":"Learning Human Skill Generators at Key-Step Levels","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T05:57:41.781154Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2502.08234"},"observation_digest":"sha256:f1abac6d175c3f75dec46fadf6ca05778e48ff1e1e821075bf7a1e0793be8067","observation_id":"88bb9576-8025-4cc8-8808-b03d213121ff","resolution":{"observed_at":"2026-08-08T05:57:41.781154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T19:09:10.112304Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2503.14734"},"observation_digest":"sha256:1a5518845d19af273c29f9312979d468bff7306dbff30e275694248389de8c00","observation_id":"c194906c-96b7-4713-9ed1-6e47904fefc2","resolution":{"observed_at":"2026-05-10T19:09:10.265640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-18T09:32:30.308050Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:9ae9b3a7009dade9f3e92e6353d6655c2db40637b9d5c49aab103b3680b805aa","observation_id":"2d112257-7b6d-421d-bd9b-fcdd312a87bf","resolution":{"observed_at":"2026-05-16T05:21:45.108596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-16T05:18:56.680232Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-19T20:36:18.684533Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T05:18:56.680232Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2504.20995"},"observation_digest":"sha256:05e21f57963a225bf9bc0e5eecebf6bddf502f9868e2ab08e3634e10932287eb","observation_id":"051bb79c-3145-466d-9f05-74b5f290a688","resolution":{"observed_at":"2026-08-16T05:18:56.680232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T23:50:45.332466Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2505.12705"},"observation_digest":"sha256:eea9e9d02abf20d5efd669e779cef7c6545b3cfbaf28da622856ed5d56bcc05c","observation_id":"f600ac19-310d-4a8d-91e9-1764e7b36504","resolution":{"observed_at":"2026-05-15T23:50:45.460888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T14:03:20.983153Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-18T01:48:22.016333Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:20.983153Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2505.20171"},"observation_digest":"sha256:18919b001d089891f2bbf7747ecc44a0f5a0cb5dc164d8641685487dc40578b2","observation_id":"aa128de2-289c-4198-b136-a9ef32aed6f5","resolution":{"observed_at":"2026-08-07T14:03:20.983153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T11:54:57.224662Z","title":"Xing, Z., Feng, Q., Chen, H., Dai, Q., Hu, H., Xu, H., Wu, Z., and Jiang, Y .-G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01182","last_updated":"2025-07-08T20:18:16Z","snapshot_observed_at":"2026-08-19T01:50:51.321167Z","submitted_at":"2025-06-01T21:33:36Z","title":"Humanoid World Models: Open World Foundation Models for Humanoid Robotics","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:57.224662Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2506.01182"},"observation_digest":"sha256:acd1cf18a77acd613ebd83b255985335c8236506898de9d8f549c6e4c98ba8f8","observation_id":"2d8f8947-9a23-4074-b1da-51f6f9ec0ed5","resolution":{"observed_at":"2026-08-07T11:54:57.224662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T11:49:46.038383Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01380","last_updated":"2025-07-04T14:56:46Z","snapshot_observed_at":"2026-08-18T20:43:04.328229Z","submitted_at":"2025-06-02T07:16:01Z","title":"Playing with Transformer at 30+ FPS via Next-Frame Diffusion","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:46.038383Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2506.01380"},"observation_digest":"sha256:92becb9fbe109ee1ecf069ac7031981a0a37fac8e4f4d5362100119983e6c1d7","observation_id":"006165f0-d22d-45b4-9a01-8dac9f634583","resolution":{"observed_at":"2026-08-07T11:49:46.038383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T11:12:11.222249Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-17T18:41:17.729750Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.222249Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:2902c439f6e6bfbb53576fa087921e70079878fc3aa7b59c1e4bbafa2016646d","observation_id":"30381dfa-6f88-438b-a9c9-990b24562a6d","resolution":{"observed_at":"2026-08-07T11:12:11.222249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T04:17:42.142859Z","title":"Pandora: Towards general world model with natural language actions and video states.arXiv preprint arXiv:2406.09455, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10975","last_updated":"2025-06-12T17:59:33Z","snapshot_observed_at":"2026-08-10T15:25:53.178624Z","submitted_at":"2025-06-12T17:59:33Z","title":"GenWorld: Towards Detecting AI-generated Real-world Simulation Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:42.142859Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2506.10975"},"observation_digest":"sha256:735502ec3e814dd7e46a4426fc405029a08febc5370c84e5cc9bfd3402e6cb9f","observation_id":"60273e96-5b3e-4da7-828d-9f31b51ea010","resolution":{"observed_at":"2026-08-07T04:17:42.142859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-06T19:42:29.513911Z","title":"Pandora: Towards general world model with natural language actions and video states.arXiv preprint arXiv:2406.09455, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05169","last_updated":"2026-06-17T19:20:50Z","snapshot_observed_at":"2026-08-18T14:42:52.569969Z","submitted_at":"2025-07-07T16:23:46Z","title":"Critique of World Model","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:42:29.513911Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2507.05169"},"observation_digest":"sha256:1b2875b49a0355ff803747eb8848c89f876b3d6a46fbff48bf24a7a26264d580","observation_id":"a2ea184f-9fb1-47ce-acc3-932979fa0630","resolution":{"observed_at":"2026-08-06T19:42:29.513911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-06T16:39:31.052113Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12952","last_updated":"2025-07-17T09:46:43Z","snapshot_observed_at":"2026-08-17T17:09:42.493624Z","submitted_at":"2025-07-17T09:46:43Z","title":"LoViC: Efficient Long Video Generation with Context Compression","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T16:39:31.052113Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2507.12952"},"observation_digest":"sha256:6db527b4fd0e890d1eabbfce644831581aab01c74df8b3086d0584127b84b157","observation_id":"7f869406-415f-4155-8be8-86ee51d25e18","resolution":{"observed_at":"2026-08-06T16:39:31.052113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-04T09:12:34.281520Z","title":"Pandora: Towards general world model with natural language actions and video states,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.16732","last_updated":"2026-06-25T19:54:02Z","snapshot_observed_at":"2026-08-19T23:45:04.716820Z","submitted_at":"2025-10-19T07:12:32Z","title":"A Comprehensive Survey on World Models for Embodied AI","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T09:12:34.281520Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2510.16732"},"observation_digest":"sha256:1e04a06d8d2a924d09ccdebfe54845cd2fe4d1cfeaed1dceb657ab3ce6ed2e30","observation_id":"0e9ea034-141b-4fae-b633-048ad3b28608","resolution":{"observed_at":"2026-08-04T09:12:34.281520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-03T13:00:58.740840Z","title":"Xing, and Zhiting Hu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01075","last_updated":"2026-05-28T18:42:26Z","snapshot_observed_at":"2026-08-16T17:25:53.373225Z","submitted_at":"2026-01-03T05:22:27Z","title":"Flow Equivariant World Models: Memory for Partially Observed Dynamic Environments","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T13:00:58.740840Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2601.01075"},"observation_digest":"sha256:89ea701b42983b8d7f122f16a6eb6f2225ecc4b89e8ef775e49557f24e2839ac","observation_id":"d7c7548a-17f3-4625-8171-e0cbe8e6c40f","resolution":{"observed_at":"2026-08-03T13:00:58.740840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2604.08719","last_updated":"2026-04-09T19:13:14Z","snapshot_observed_at":"2026-08-14T09:41:09.940565Z","submitted_at":"2026-04-09T19:13:14Z","title":"LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T17:36:38.627415Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2604.08719"},"observation_digest":"sha256:a3813763d23d6ae0270581f17686386939085c2f35d9e7cc768779c6df1f4e87","observation_id":"b9bd75a8-056a-4afe-bad0-3243c18aed35","resolution":{"observed_at":"2026-05-11T06:31:01.454675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2604.08780","last_updated":"2026-08-17T14:43:24Z","snapshot_observed_at":"2026-08-20T23:15:50.106370Z","submitted_at":"2026-04-09T21:31:24Z","title":"Morphology-Conditioned World Model for Cross-Embodiment Quadrupedal Locomotion","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T16:53:48.187942Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2604.08780"},"observation_digest":"sha256:ea7453ad11a5b846d015f216a7730d4fed76584909befc9b33a88312859518dc","observation_id":"bda590f2-972f-4224-b960-a33d2f94520a","resolution":{"observed_at":"2026-05-11T07:56:00.561554Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2604.17749","last_updated":"2026-04-20T03:07:22Z","snapshot_observed_at":"2026-08-15T03:06:30.351654Z","submitted_at":"2026-04-20T03:07:22Z","title":"Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T05:26:48.606759Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2604.17749"},"observation_digest":"sha256:d31b316c6270b312519835e9726737595cb10840e7188a4e3d29a3102e03b830","observation_id":"e01e77da-1565-4b3f-89a4-3dbf4fe1880f","resolution":{"observed_at":"2026-05-10T06:56:47.993797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2606.00133","last_updated":"2026-05-28T21:23:24Z","snapshot_observed_at":"2026-08-21T12:45:59.589445Z","submitted_at":"2026-05-28T21:23:24Z","title":"World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications","version":1},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-06-29T08:36:23.776293Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2606.00133"},"observation_digest":"sha256:57a9ce4c6bce7cbeac42e3f5fdaae2cf27f11e1dd99d120a83754a849dada53c","observation_id":"bd994373-324a-457d-8a02-bf89f463e4f2","resolution":{"observed_at":"2026-06-29T08:43:15.751187Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2606.09507","last_updated":"2026-06-08T13:59:50Z","snapshot_observed_at":"2026-08-14T10:19:53.446609Z","submitted_at":"2026-06-08T13:59:50Z","title":"Prisma-World: Camera-Controllable Multi-Agent Video World Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T17:03:29.676482Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2606.09507"},"observation_digest":"sha256:5e82427bb76279693a6f48988f4ab54dab46d2b4d19c9775bca15b39c2d82dc1","observation_id":"6268af23-1f16-4249-a337-033a2254492b","resolution":{"observed_at":"2026-07-03T00:47:30.102790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2606.12191","last_updated":"2026-06-10T15:15:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-10T15:15:01Z","title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","version":1},"reference_index":194,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:30.702256Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2606.12191"},"observation_digest":"sha256:119bb8e2e1483d0845113d95699aa21980d55f3e7c3e6e30474e25c1df4515b7","observation_id":"0bf279b0-7089-41dd-8278-63928015cc60","resolution":{"observed_at":"2026-06-27T09:50:48.447799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-29T02:03:45.564122Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:3ebfa1be265f240112959076991111e0a49a2c2e0ea0eae727408490d3eb649d","observation_id":"592752e2-d17f-48dd-bc61-630bf4b21c0d","resolution":{"observed_at":"2026-07-01T18:25:57.746377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-01T06:25:58.872140Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:a1b6581529cd221f151d240092f5f71e4ceae90f7537bd28fa52e66710a52840","observation_id":"d20b2251-decf-466b-93cb-62ab8e0a399e","resolution":{"observed_at":"2026-07-01T09:35:40.537892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-02T20:52:28.444524Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:ebca55cf2fc2d9352ae7d87ccc6fdfd46c5c9e83ec6341a80fac7ba5677899f7","observation_id":"63d460f8-e025-49a5-925e-e4e687e77656","resolution":{"observed_at":"2026-07-02T20:57:22.760797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-03T22:44:16.272541Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:f40c451b0e14a602ab7ad412ad993b3bd55861711cfc7e8c5628397b0d0edbc2","observation_id":"36d2f968-cd7c-48d6-8a36-5eb4e6f878dc","resolution":{"observed_at":"2026-07-03T22:49:00.909463Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-07-14T17:14:19.770867Z","title":"arXiv preprint arXiv:2406.09455 (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T17:14:19.770867Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:09168312533fddb66421caecdf18b56d22a7ebf208c9c11db9692f12a878b3ce","observation_id":"e36dc4ec-1d82-4f27-a091-eea60eaeba19","resolution":{"observed_at":"2026-07-14T17:14:19.770867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-02T10:00:15.354616Z","title":"arXiv preprint arXiv:2406.09455 (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27537","last_updated":"2026-07-19T21:49:02Z","snapshot_observed_at":"2026-08-05T10:16:29.451498Z","submitted_at":"2026-06-25T20:37:39Z","title":"MemoBench: Benchmarking World Modeling in Dynamically Changing Environments","version":6},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T10:00:15.354616Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2606.27537"},"observation_digest":"sha256:bf7324c544d895205516adb3577015130fc4bd23dcf8b112bc68ec9270be91dd","observation_id":"01f82b13-7992-4054-81e9-1d0d2724eff5","resolution":{"observed_at":"2026-08-02T10:00:15.354616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":"2406.09455","doi":"10.48550/arxiv.2406.09455","metadata_source":"pith","pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":"cs.CV","work_id":"f083b1bb-feb6-4a11-a14a-810796bbd70f","year":2024},"citing_paper":{"arxiv_id":"2607.06559","last_updated":"2026-07-07T17:58:15Z","snapshot_observed_at":"2026-08-18T08:45:47.925479Z","submitted_at":"2026-07-07T17:58:15Z","title":"RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T02:00:30.551638Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2607.06559"},"observation_digest":"sha256:f30b0a25e188fd201857ed1ae7515321c5f1e8e75556eac36c2a999560c73bfb","observation_id":"20c70fbb-8ee1-4330-a850-76be7e7c1230","resolution":{"observed_at":"2026-07-08T02:04:26.172719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-07-14T03:51:24.547781Z","title":"arXiv preprint arXiv:2406.09455 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11689","last_updated":"2026-07-13T15:22:56Z","snapshot_observed_at":"2026-08-20T06:23:24.871101Z","submitted_at":"2026-07-13T15:22:56Z","title":"From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence","version":1},"reference_index":184,"source":"arxiv_source","source_observed_at":"2026-07-14T03:51:24.547781Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2607.11689"},"observation_digest":"sha256:2adb8467952123f6d86e8035798e8d8c3291de60fc6910c20d502128f1580095","observation_id":"2faa3f44-bfad-4327-a583-c1c72affc29e","resolution":{"observed_at":"2026-07-14T03:51:24.547781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-02T03:16:53.090709Z","title":"Pandora: Towards general world model with natural language actions and video states.arXiv preprint arXiv:2406.09455, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13960","last_updated":"2026-07-17T13:39:37Z","snapshot_observed_at":"2026-08-15T15:04:36.907110Z","submitted_at":"2026-07-15T15:46:42Z","title":"GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.090709Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2607.13960"},"observation_digest":"sha256:ec1fff3732b27646d49a58adce642137b336671d9ec632ac6341de3fd94b314d","observation_id":"62a1fd9c-bbcc-4b8a-a679-944154b2e172","resolution":{"observed_at":"2026-08-02T03:16:53.090709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-02T02:52:19.089018Z","title":"Xiang, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14076","last_updated":"2026-07-15T17:48:48Z","snapshot_observed_at":"2026-08-12T15:43:58.148008Z","submitted_at":"2026-07-15T17:48:48Z","title":"From Pixels to States: Rethinking Interactive World Models as Game Engines","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T02:52:19.089018Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2607.14076"},"observation_digest":"sha256:d9da4e82d116cf6ee9a1f5fbcb6dc4fb440e321c766e99d2295130d2ac0ca70f","observation_id":"fcc5c7dc-6a63-45cd-8375-049ad20cf3b3","resolution":{"observed_at":"2026-08-02T02:52:19.089018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-01T07:14:42.526248Z","title":"Xiang, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21522","last_updated":"2026-07-23T17:04:36Z","snapshot_observed_at":"2026-08-07T01:35:32.908201Z","submitted_at":"2026-07-23T17:04:36Z","title":"GS-Agent: Creating 4D Physical Worlds With Generative Simulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T07:14:42.526248Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2607.21522"},"observation_digest":"sha256:0bcf38c597d173eb5300fbfab4bf9ba1b7b6ae24e43f4da261c4507cda595cb8","observation_id":"db262d06-6a05-4ef1-9b3c-8bbbe87643c3","resolution":{"observed_at":"2026-08-01T07:14:42.526248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-07-31T01:50:30.693619Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28624","last_updated":"2026-07-30T17:59:46Z","snapshot_observed_at":"2026-08-17T09:28:25.316512Z","submitted_at":"2026-07-30T17:59:46Z","title":"PhiZero: A World Model Built Around Physical Language","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T01:50:30.693619Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2607.28624"},"observation_digest":"sha256:6f465f6f2660b6e772dde296b6aef29cb47b4ca9707ac7f13db86eabce0667bf","observation_id":"27aa3071-d292-480a-8d4c-316f1400487c","resolution":{"observed_at":"2026-07-31T01:50:30.693619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.09455/citation-record","integrity":"/paper/2406.09455/integrity","json":"/paper/2406.09455/citation-record.json","paper":"/paper/2406.09455"},"outbound":[],"paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T09:56:32.608622Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2406.09455."}