{"as_of":"2026-08-05T09:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b523830b31317576959f9adc156a0e09dc993cafd6c9925268e6d0fda9c56ef6","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T17:50:59.797593Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T06:04:22.499402Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18576","snapshot_observed_at":"2026-08-05T06:04:22.499402Z","title":"DriVerse: Navigation world model for driving simulation via multimodal trajectory prompting and motion alignment.arXiv preprint arXiv:2504.18576, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07996","last_updated":"2026-07-20T17:34:32Z","snapshot_observed_at":"2026-08-05T06:03:57.824747Z","submitted_at":"2025-09-04T17:59:58Z","title":"3D and 4D World Modeling: A Survey","version":4},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-08-05T06:04:22.499402Z"},"links":{"cited_paper":"/paper/2504.18576","citing_paper":"/paper/2509.07996"},"observation_digest":"sha256:e8cbba080ebaaca0f23e62bbe4456983a72883f66aa3b3ff38c9de925cb0459b","observation_id":"3bc597f2-0248-4bcb-a906-0b9245f03144","resolution":{"observed_at":"2026-08-05T06:04:22.499402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.18576/citation-record","integrity":"/paper/2504.18576/integrity","json":"/paper/2504.18576/citation-record.json","paper":"/paper/2504.18576"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"7a823389-ea55-4f5e-a2b5-5f739d631f49","year":null},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:74303c8e607aedfa632655edf620ff1c8ee18c6567d6da24d874252ace734cc1","observation_id":"c541bcf5-fbcf-4b88-ae5c-c42b3dfef504","resolution":{"observed_at":"2026-05-22T17:51:55.744453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:6150e6ef23aa169f9015602c3b35840036d6bbb9936acaf02b30ea744f306f72","observation_id":"50cb4175-3ebd-441b-91b3-c4bc0f19128f","resolution":{"observed_at":"2026-05-22T17:51:54.776728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11762","last_updated":"2025-04-24T13:08:08Z","snapshot_observed_at":"2026-07-06T16:49:58.524003Z","submitted_at":"2023-11-20T13:40:40Z","title":"MUVO: A Multimodal Generative World Model for Autonomous Driving with Geometric Representations","version":4},"cited_work":{"arxiv_id":"2311.11762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11762","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muvo: A multimodal generative world model for autonomous driving with geometric representations","venue":null,"work_id":"f2cab74c-c7ef-4cf4-9a6d-a1bf5c04c614","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2311.11762","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:18a9e142f2d34007fbaf91820519a221ddba9b70e3f6b0c9678eebb3bc76e136","observation_id":"0274046d-7a9f-4037-bde2-f6884bac9862","resolution":{"observed_at":"2026-05-22T17:51:54.755109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video generation models as world simula- tors","venue":null,"work_id":"d334f32a-19c3-4d30-9f41-07f28a0ec583","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:d93eae71aaf3816932bbd9824ebda2b9fe875c89588bbef877cd5827eadf371c","observation_id":"e524d77f-c9c9-46ff-b170-6e539386a680","resolution":{"observed_at":"2026-05-22T17:51:55.734333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nuscenes: A mul- timodal dataset for autonomous driving","venue":null,"work_id":"d377fdb4-091d-4a3e-bf17-0308b004e369","year":2020},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:5eb534a14870be9d085c77cf539b7dff8a04ac08617ac59d9ac8c1c35b434a88","observation_id":"1ec5fec8-5802-4c24-b426-6b7842e220fb","resolution":{"observed_at":"2026-05-22T17:51:55.737757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egocentric vehicle dense video captioning","venue":null,"work_id":"1e0b923b-a976-4016-b3c3-cb181439a8d0","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:e5b780f66516f21e9012df18b4366b2944519fd310fc8fdba7bd5c1fe6a33768","observation_id":"72075763-3a92-41f8-9f00-45c804b9f53f","resolution":{"observed_at":"2026-05-22T17:51:55.730789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":"f5ce7fca-8eda-4536-9d32-455028e48a7e","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:a05357aad1d987d096c347cc835e3874a40da17948a73101d28d11c1cea8a85d","observation_id":"07ec21b4-f73d-4998-9320-c680a592620a","resolution":{"observed_at":"2026-05-22T17:51:55.727476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14404","last_updated":"2023-04-27T17:59:32Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:32Z","title":"Motion-Conditioned Diffusion Model for Controllable Video Synthesis","version":1},"cited_work":{"arxiv_id":"2304.14404","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14404","snapshot_observed_at":"2026-07-03T22:49:00.819668Z","title":"Motion- Conditioned Diffusion Model for Controllable Video Synthesis","venue":null,"work_id":"4f9964d7-7be1-4a28-a838-32c54a1da3e5","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2304.14404","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:33806cb947079b770d02c0d3214bb7d98ff8b8f8f707f681b34729d5154f4190","observation_id":"b3011141-76cb-4ef0-a18d-5d7b8ffa65b9","resolution":{"observed_at":"2026-05-22T17:51:54.740213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13840","last_updated":"2024-08-12T08:30:05Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T09:03:19Z","title":"Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning","version":3},"cited_work":{"arxiv_id":"2305.13840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13840","snapshot_observed_at":"2026-07-03T14:08:22.301987Z","title":"Control-a-video: Controllable text-to-video generation with diffusion models","venue":null,"work_id":"321f338a-78e3-419f-81b0-cce38abc7207","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2305.13840","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:8c34e662da91dad0076c3d24a9a33fc3015b445c7c3d4614d65907e0275b9d9e","observation_id":"39eb1e77-0228-4df2-911b-f524723c8380","resolution":{"observed_at":"2026-05-22T17:51:54.746635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seine: Short-to-long video diffu- sion model for generative transition and prediction","venue":null,"work_id":"82af6b5e-595f-44f6-a16c-b932cc0c16ff","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:b1aa9249ee156c4708fe40c2545102525a8277dd74b15ccf56ea0b22668485d0","observation_id":"2261e68e-b6c5-407c-b12f-91706e413f62","resolution":{"observed_at":"2026-05-22T17:51:55.740993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18607","last_updated":"2024-12-24T18:59:37Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-24T18:59:37Z","title":"DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers","version":1},"cited_work":{"arxiv_id":"2412.18607","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18607","snapshot_observed_at":"2026-07-04T20:50:12.101933Z","title":"Driving- gpt: Unifying driving world modeling and planning with multi-modal autoregressive transformers","venue":null,"work_id":"5f272f4e-8a1d-4561-8f56-75d7d9ff9523","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2412.18607","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:6f4feb1a36d1d3c21020d4a016d6748108b993422ff0cbca7a4e7b9acecf0e33","observation_id":"65513e27-4698-41b1-a0e2-c6752e4f1dc9","resolution":{"observed_at":"2026-05-22T17:51:54.731884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"3c2a0f38-afe3-4866-ad46-da1b27574e36","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:4d583e2e0d863d702587a785d621327e93d64d2fb83b1958d4b4e9d0b323fdf3","observation_id":"d3639ddd-d649-4eb5-b452-7acaaa550fae","resolution":{"observed_at":"2026-05-22T17:51:55.719551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02601","last_updated":"2024-05-03T04:50:27Z","snapshot_observed_at":"2026-07-06T16:27:31.403609Z","submitted_at":"2023-10-04T06:14:06Z","title":"MagicDrive: Street View Generation with Diverse 3D Geometry Control","version":7},"cited_work":{"arxiv_id":"2310.02601","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.02601","snapshot_observed_at":"2026-07-08T03:24:28.755891Z","title":"Magicdrive: Street view generation with diverse 3d geometry control","venue":"cs.CV","work_id":"0d62d074-2eec-4693-9b9b-3dd8367909d9","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2310.02601","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:a87b1528e54e9f8114489535c19dae901ffd6f242a0155be4277833074e569d1","observation_id":"eed07f90-bb49-4cf7-a42b-cb408efa4897","resolution":{"observed_at":"2026-05-22T17:51:54.718199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":"616dc342-8448-4f18-8dcb-8effe1447af2","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:d11c2ab16c82ec0ac6b89d5d7aa3beee684227c22453b0c1505dc9586e4a868b","observation_id":"73f3295a-a53a-4968-a631-4e9e23a603b1","resolution":{"observed_at":"2026-05-22T17:51:55.711265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10171","last_updated":"2025-03-09T18:06:08Z","snapshot_observed_at":"2026-07-06T19:50:56.818819Z","submitted_at":"2024-11-15T13:17:54Z","title":"Imagine-2-Drive: Leveraging High-Fidelity World Models via Multi-Modal Diffusion Policies","version":2},"cited_work":{"arxiv_id":"2411.10171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10171","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagine-2-drive: High-fidelity world modeling in carla for autonomous vehi- cles","venue":null,"work_id":"2fb6dbc0-b0e6-4b4c-a206-0c12fcf20114","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2411.10171","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:5da700fd556e3e145d115fd634c9b91b156ca830a7c354978ac12819d3380427","observation_id":"2d160113-ce40-4632-af18-5813875255ea","resolution":{"observed_at":"2026-05-22T17:51:54.835186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Worldgpt: Empowering llm as multimodal world model","venue":null,"work_id":"75349638-8938-455f-8c96-245f14e936c0","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:5a385866a7cc90a0910a9cb4772abfba04db1ac4530facafb0935c082af1622d","observation_id":"86454e76-ceec-4ee4-b9f0-8602b53dbee9","resolution":{"observed_at":"2026-05-22T17:51:55.715298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10429","last_updated":"2024-10-14T12:24:32Z","snapshot_observed_at":"2026-07-06T19:33:00.110753Z","submitted_at":"2024-10-14T12:24:32Z","title":"DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model","version":1},"cited_work":{"arxiv_id":"2410.10429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10429","snapshot_observed_at":"2026-07-04T03:29:29.474307Z","title":"Dome: Tam- ing diffusion model into high-fidelity controllable occupancy world model","venue":null,"work_id":"a319c6c5-4f7e-41dc-bc52-b4d6ae93b698","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2410.10429","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:56da466fff4595a794a49c1eb99f43adb9e2914abb5b8c7e64dc8ac12a4d460b","observation_id":"9b125c01-8d02-4d49-a876-30b171bb7c18","resolution":{"observed_at":"2026-05-22T17:51:54.724798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World models for autonomous driving: An initial survey","venue":null,"work_id":"c6bb13ad-7430-48cf-b269-17888c93d51b","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:4029d39c79419f22b33afd4de82a55f99a6274a11a4c7c805ca31c14a5b3cc42","observation_id":"95fae8a7-4183-433a-b15c-307cb9c4f028","resolution":{"observed_at":"2026-05-22T17:51:55.748156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01522","last_updated":"2024-12-04T02:09:07Z","snapshot_observed_at":"2026-07-06T20:00:14.194746Z","submitted_at":"2024-12-02T14:15:41Z","title":"InfinityDrive: Breaking Time Limits in Driving World Models","version":2},"cited_work":{"arxiv_id":"2412.01522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01522","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinitydrive: Breaking time limits in driving world models","venue":null,"work_id":"14917e8c-ba8b-4a2b-a3d6-0e5bb9a07a28","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2412.01522","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:53f6c7fafb1b1681c9b4f8d7225e698546eeb77ecb435478c706c9d3060aac2c","observation_id":"99829b07-8620-4827-a4a3-a9d22cffd24c","resolution":{"observed_at":"2026-05-22T17:51:54.864397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16933","last_updated":"2023-11-28T16:33:08Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T16:33:08Z","title":"SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models","version":1},"cited_work":{"arxiv_id":"2311.16933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.16933","snapshot_observed_at":"2026-07-04T14:59:55.944956Z","title":"Sparsectrl: Adding sparse con- trols to text-to-video diffusion models","venue":null,"work_id":"60be35f2-8ed0-4970-afc1-5017f0ae78f2","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2311.16933","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:b1561727dd44f5ac7f7245a6f9e05d991366f2d76a709a790a85fe2a1945af3b","observation_id":"b18700b2-157e-4f46-9290-21b2ace71ba8","resolution":{"observed_at":"2026-05-22T17:51:54.706326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2312.06662","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-07-03T23:59:06.270972Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"ddd00738-0fa8-47a1-95b7-711cfe1ca04d","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:955fabb0b75eb5acb957ed74dc5eebf09dfd4e1742a4b76ee77349b75735c2e7","observation_id":"6f4eda9c-22d6-40d1-9867-623cc893613e","resolution":{"observed_at":"2026-05-22T17:51:54.847724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World models","venue":null,"work_id":"cab66a22-7d1d-412a-a98f-9d78004ba383","year":2018},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:077ead2cf11fb7926e4dad08b0e7fda386ccadcd0ea25cf7e6503d2e704bdcd0","observation_id":"d4898aab-27c6-4291-8e3c-4dd4ddc11a48","resolution":{"observed_at":"2026-05-22T17:51:55.703421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2404.02101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-10T01:46:41.167891Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","venue":"cs.CV","work_id":"1c05c278-c023-4ef0-a359-25a41f1065eb","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:df8ff62fe83b2c7916c227612ae87df56b11b6697f5f3c5138fb84a3aad40b47","observation_id":"b2c6f6f3-9cd7-497a-9711-064328e9bf52","resolution":{"observed_at":"2026-05-22T17:51:54.694378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":"2211.13221","doi":"10.48550/arxiv.2211.13221","metadata_source":"pith","pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","venue":"cs.CV","work_id":"23338b3d-620a-4954-904f-bab6a577b8a5","year":2022},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:e72d869375d56c53418f8c8b8e1be7d56a39451a3e43bfdf4e0a708cc8ac062e","observation_id":"88c9db44-0f5c-4ae6-8a78-fb3a60c06803","resolution":{"observed_at":"2026-05-22T17:51:54.699920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"1982a292-e8ce-48e1-8cfb-842a359b3409","year":2017},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:3a7b6e39622d726577645327f96773a66aaa42774f035bd9b72a25971a604993","observation_id":"3ffef5cc-22ef-4070-9479-b7aae8d93c00","resolution":{"observed_at":"2026-05-22T17:51:55.691445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"f24f111f-d5ec-48a6-aa52-8a4b37d77750","year":2020},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:3ac1067285bd5c4825bd5bf366ee9a32d2b60df059a7f7b23263a0fdf1cc1c8e","observation_id":"b255becc-7de5-4096-87c6-f70b1982766a","resolution":{"observed_at":"2026-05-22T17:51:55.695224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2204.03458","doi":"10.48550/arxiv.2204.03458","metadata_source":"pith","pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video Diffusion Models","venue":"cs.CV","work_id":"02e03469-549e-4b5a-9bf0-ac6617a89882","year":2022},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:fc7bb1ad8cf93560670fe63463dbf888a9c024e0ae6e90dec16cf04f29d78db6","observation_id":"ce9b8e7b-e051-4f83-b0a8-ee947b1b4cdc","resolution":{"observed_at":"2026-05-22T17:51:54.683683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:2fa910a75e98738967ab392bd291b38cca0c2c53a698ab5a721d2851655b574f","observation_id":"660e8fdb-18ee-419a-8cf5-22757088b637","resolution":{"observed_at":"2026-05-22T17:51:54.673615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17080","last_updated":"2023-09-29T09:20:37Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T09:20:37Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2309.17080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17080","snapshot_observed_at":"2026-07-10T11:47:02.949785Z","title":"GAIA-1: A Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"313484e6-a442-4522-8e19-d07e502844a8","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2309.17080","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:d29b0c316a4183e1ec8baf8d4b2330adb5470da2bd747f9ee98622fd5fd8f745","observation_id":"11ef6806-0daa-4193-8a2b-1d6dee6450fa","resolution":{"observed_at":"2026-05-22T17:51:54.661835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:9bafd6974e38dcfe82fc8d5f105d8d9f1f25c16521dcd2bf43c982f2909ee0d6","observation_id":"4c868ae8-99c0-416d-b2ac-9287cffd740a","resolution":{"observed_at":"2026-05-22T17:51:54.655829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":"2311.17117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-07-04T13:49:51.618818Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":"1e7ba329-c89f-49b5-b1b3-252771088f16","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:e4bc54661d873186e31a77f5a6264b886bd1578196c0d06f62d396accfe4ce58","observation_id":"1edfbc81-ef62-4cd6-ba35-a214f04c037d","resolution":{"observed_at":"2026-05-22T17:51:54.679201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19505","last_updated":"2024-12-30T09:08:12Z","snapshot_observed_at":"2026-07-06T20:13:36.042546Z","submitted_at":"2024-12-27T07:44:07Z","title":"DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT","version":2},"cited_work":{"arxiv_id":"2412.19505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19505","snapshot_observed_at":"2026-07-02T12:46:57.095080Z","title":"Driving- world: Constructingworld model for autonomous driving via video gpt","venue":null,"work_id":"b753c190-c8c0-41ac-89c9-3c549b616477","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2412.19505","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:690dc38c8dc9818cb1c985071fbfb5309e85ae2ca052306ed998e95eb0d6362e","observation_id":"0db9d819-b5bb-41d5-8218-c317dea44932","resolution":{"observed_at":"2026-05-22T17:51:54.689364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13549","last_updated":"2023-11-22T17:44:29Z","snapshot_observed_at":"2026-07-06T16:51:15.252642Z","submitted_at":"2023-11-22T17:44:29Z","title":"ADriver-I: A General World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2311.13549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13549","snapshot_observed_at":"2026-07-01T09:55:40.884710Z","title":"Adriver-i: A general world model for autonomous driving","venue":null,"work_id":"e601ca37-4a47-4d11-aefc-857f5ca5501a","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2311.13549","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:c2bfb0894235a413ecdab1a444b147838e3aa95a00f8a9e3976406c305038270","observation_id":"ef0e5092-39cf-4df4-8290-e7f40439e6e2","resolution":{"observed_at":"2026-05-22T17:51:54.644904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01595","last_updated":"2024-09-03T04:29:59Z","snapshot_observed_at":"2026-07-06T19:09:32.189008Z","submitted_at":"2024-09-03T04:29:59Z","title":"DiVE: DiT-based Video Generation with Enhanced Control","version":1},"cited_work":{"arxiv_id":"2409.01595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01595","snapshot_observed_at":"2026-07-04T09:49:44.190727Z","title":"Dive: Dit-based video generation with enhanced control","venue":null,"work_id":"798c417e-ce37-4fe0-970b-11592222f92a","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2409.01595","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:cb95527246b648d7f05b64333d2d54df9d72610877b82554b9d87ea2ace22a08","observation_id":"3499af05-3870-4a26-bf10-6eb980322753","resolution":{"observed_at":"2026-05-22T17:51:54.650274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11831","last_updated":"2024-10-15T17:56:32Z","snapshot_observed_at":"2026-08-03T21:35:04.144048Z","submitted_at":"2024-10-15T17:56:32Z","title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos","version":1},"cited_work":{"arxiv_id":"2410.11831","doi":"10.48550/arxiv.2410.11831","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.11831","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cotracker3: Simpler and better point tracking by pseudo-labelling real videos","venue":"arXiv (Cornell University)","work_id":"3aa5162a-5b12-4d77-b648-b7f9f7f98df3","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2410.11831","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:95d0950a69c9ce65bee3c94d29b6191222ea5d4cb0f338486db5ba0660e5a51b","observation_id":"5188c8ad-28d5-4576-95ed-bbd2b9888a80","resolution":{"observed_at":"2026-05-22T17:51:54.712389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:27.300163+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:27.300163+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreampose: Fashion video synthesis with stable diffusion","venue":null,"work_id":"ca6b3a25-1767-4422-bcce-104554b33843","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:11f3b5b407070ab65b9f4974533d69995ea872f32c899935b070cbe11a3155ec","observation_id":"1a69d20f-c681-48f3-b8c3-9f209e9e683b","resolution":{"observed_at":"2026-05-22T17:51:55.671052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text2video-zero: Text-to- image diffusion models are zero-shot video generators.IEEE International Conference on Computer Vision (ICCV)","venue":null,"work_id":"d649c221-63a6-4708-a027-c0cbb370ff49","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:3c73f332b117b65b57ebee3dd21239caba235b57a7de75a28770ca1e0a79076f","observation_id":"1894530a-a81e-45c3-88e0-76825aa06410","resolution":{"observed_at":"2026-05-22T17:51:55.674947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drivegan: Towards a controllable high-quality neural simulation","venue":null,"work_id":"5786a701-bd4e-47ca-83b0-8ea40a132206","year":2021},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:e98e0156979961dd43930eded153b50b385cc4c7a44ce521db16685ef388e956","observation_id":"8caf6e55-ac9a-4ee7-b9d6-729e78555d61","resolution":{"observed_at":"2026-05-22T17:51:55.678809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:d57fd2e0401d60eba39ae71440e737c33155846e2c3ed4ed212d7c6ab28c6e29","observation_id":"3fd18643-4b44-48ce-9684-60c483cc1370","resolution":{"observed_at":"2026-05-22T17:51:54.639429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drivingdiffusion: Layout-guided multi-view driving scenarios video genera- tion with latent diffusion model","venue":null,"work_id":"9cbae26d-95e8-4463-aa52-d2cb79bd105a","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:bb607943ee4777d7e68cab8efd8b2198fc6c3cd39c6f38e8792b99effd75cd7a","observation_id":"b97e8a5f-2d37-4aea-aa14-e0fc2e385437","resolution":{"observed_at":"2026-05-22T17:51:55.657657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.13587","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:06:14.262151Z","title":"Seeing the future, perceiving the future: A unified driving world model for future generation and perception","venue":null,"work_id":"55dbb694-fedd-494a-ac67-5e3012172ed3","year":2025},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:c41fb7bc7e5e7d6ef1b96f23f6a6c36ca7405a34a5cc8f07d4720aeb52ff582a","observation_id":"4d7749e7-349e-4cb2-87a6-1c7f259ae55d","resolution":{"observed_at":"2026-05-22T17:51:54.623605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wovogen: World volume-aware diffusion for con- trollable multi-camera driving scene generation","venue":null,"work_id":"f6f15891-8c20-4317-98b0-c7ea61d5dabb","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:a100301a41e033368cad77ef48ac574a0982e1fb01cbcc470197c2347a52208d","observation_id":"0ec472b5-ae04-4f00-8d51-8f195fda1ea2","resolution":{"observed_at":"2026-05-22T17:51:55.649542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":"2401.03048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-07-10T01:46:41.160163Z","title":"Latte: Latent Diffusion Transformer for Video Generation","venue":"cs.CV","work_id":"5328e907-7278-4781-a2bb-c5ef40dc87fb","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:7cfe74ccf50db10fe6b79e45adf73572935dc4c24e5f257a2438a7be49bf1e51","observation_id":"27cbe38a-cb18-4714-b0c8-45cc0d2d0a16","resolution":{"observed_at":"2026-05-22T17:51:54.633645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Driveworld: 4d pre-trained scene understanding via world models for autonomous driving","venue":null,"work_id":"94ee9c23-3ab4-4627-babe-25ca66ac0770","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:a315e993afda84825d57d68122db1629cfba96b3578b6ff47afaed6f39614dea","observation_id":"7368effd-67c7-4b28-99c8-03ed6ead9162","resolution":{"observed_at":"2026-05-22T17:51:55.653807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orb-slam: a versatile and accurate monocular slam system","venue":null,"work_id":"b0b03907-cd9b-4ab5-9a89-0780a4947674","year":2015},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:2e84735cac35f30029926422c5621a267532c602ce70b64a64a25e4489b0c4fb","observation_id":"1db70d7e-7e0d-4706-a974-e6e583a35ebf","resolution":{"observed_at":"2026-05-22T17:51:55.666861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":"2212.09748","doi":"10.48550/arxiv.2212.09748","metadata_source":"pith","pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable Diffusion Models with Transformers","venue":"cs.CV","work_id":"a3a05169-18b1-42bb-8775-eada50163437","year":2022},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:4a0d031ae392b35123eb58f5e3d1c53241a7ac82a6e19b2474f31eb565ff5d39","observation_id":"7c6a551c-a234-4e9c-aef3-9ba8c8c331b8","resolution":{"observed_at":"2026-05-22T17:51:54.793778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"78576d0a-f6d3-41f3-9167-eb77dcecebd0","year":null},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:f58a09e5506d518342a4e4934d992b565d3189e7da65670535d2a22685bc934f","observation_id":"9b2c9a80-fa57-4812-b412-0c0367f74684","resolution":{"observed_at":"2026-05-22T17:51:55.723571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Com- positional 3d scene generation using locally conditioned dif- fusion","venue":null,"work_id":"b7ace9c3-3faa-4fd4-8e98-5cecd45b4695","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:e5f32427624ed163f3783606ece161bc4e0a2bbe843a8560ae252f4fd0de8bbb","observation_id":"072748ef-209d-4760-ad5c-41291fef23b0","resolution":{"observed_at":"2026-05-22T17:51:55.683304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"e3ce127d-e6a7-4624-b278-cde73d252569","year":2022},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:939abccceae06387aec821b92859cfb2f734ed3048062cade08465c83338cb75","observation_id":"b9618594-b801-4dfa-b808-15609a3e45bd","resolution":{"observed_at":"2026-05-22T17:51:55.699283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-diffusion: Learning multi-modal diffusion mod- els for joint audio and video generation","venue":null,"work_id":"3adfa7ec-84b7-4bb3-b40f-d156a7af5a23","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:dcde36d7e718fdc86fd32b016ecc9a21fd2b5a062df05508546b92769f7ca169","observation_id":"3cb1214f-f892-4675-bbaf-5be43978695a","resolution":{"observed_at":"2026-05-22T17:51:55.640839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:11c1df7031c408c9873790d572feacab5fffc962bbc97e222268f79eacfe4784","observation_id":"07123a29-1c04-410c-82a3-93cc5b23e58a","resolution":{"observed_at":"2026-05-22T17:51:54.628356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"f7e6f866-9b3c-412e-a0fe-1c917c060be3","year":2020},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:ea6fbca9637d175e4214553703785e4e1feac2bf5444b7be232b808ac7c9cdb4","observation_id":"7c9235a9-3a91-4b3f-b507-eb19f1e0dc95","resolution":{"observed_at":"2026-05-22T17:51:55.636568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.10498","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T17:43:45.789563Z","title":"The role of world mod- els in shaping autonomous driving: A comprehensive survey","venue":null,"work_id":"f70bbb2e-90fe-4410-a4e1-ec76db1cc7d9","year":2025},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:5f889aec29c9b03f552b3988e0db9e771674b09b8d71c37a2a5665aec13fe45a","observation_id":"e7c82a57-e5cf-44da-ae32-c0988dfaf63d","resolution":{"observed_at":"2026-05-22T17:51:54.788354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"95f38830-881b-480e-ab00-475d7215387a","year":2019},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:4875e23ac381a390816cf352c1083b9eb67e2b6c6911887c5889a67d42b8263b","observation_id":"48ea7da1-321f-442e-a7c8-eaca14c9094a","resolution":{"observed_at":"2026-05-22T17:51:55.632052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20337","last_updated":"2024-05-30T17:59:42Z","snapshot_observed_at":"2026-08-02T21:48:22.210406Z","submitted_at":"2024-05-30T17:59:42Z","title":"OccSora: 4D Occupancy Generation Models as World Simulators for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2405.20337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.20337","snapshot_observed_at":"2026-07-08T07:14:45.151103Z","title":"Occsora: 4d occupancy generation models as world simulators for au- tonomous driving","venue":"cs.CV","work_id":"4a896b5b-eb1e-4ff5-baa3-401b9574feaf","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2405.20337","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:667d29b26ad5ac60246e0e50132ba1a01ecb041ba60855e194ed3fe94e7d3485","observation_id":"a039d66a-7c9c-42a0-afee-a14999f0a304","resolution":{"observed_at":"2026-05-22T17:51:54.760892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drivedreamer: Towards real-world- drive world models for autonomous driving","venue":null,"work_id":"887feadd-e634-48bc-927d-90c1f4b3c460","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:2daf1d362f9295fa9a12018bf1138e21e9ab4ab6d61113b8dac4200fa66b79d9","observation_id":"276dcec8-7a45-45cd-a6d2-a31b506fcd19","resolution":{"observed_at":"2026-05-22T17:51:55.645460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drivedreamer: Towards real-world- driven world models for autonomous driving","venue":null,"work_id":"70dcbd22-5430-4964-8e18-6c45c47ecab3","year":null},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:868cff626378650c98851f6d3f2c663b0fc78d67ad717bb0d66f274cf7b2c79a","observation_id":"13aae856-cb42-4a42-af00-63df85253f3c","resolution":{"observed_at":"2026-05-22T17:51:55.628088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for au- tonomous driving","venue":null,"work_id":"9c083914-9cb5-411e-8047-b7e46833a645","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:d7a46528738721836d661d85e06bc2ea7c4474a4d7dd4ede61c245935361dfcf","observation_id":"363f0151-72db-4be5-99c9-05a657109b8b","resolution":{"observed_at":"2026-05-22T17:51:55.687341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for au- tonomous driving","venue":null,"work_id":"4a1d68ef-1b63-47ed-95bb-479be17482ca","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:d2835789e03a8eb2e0a319432ceb960d6750b10b76c027cef43e0365aa11d638","observation_id":"de095bc1-711e-4303-98d3-1954263d3b0e","resolution":{"observed_at":"2026-05-22T17:51:55.751512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03641","last_updated":"2024-07-16T17:27:10Z","snapshot_observed_at":"2026-07-06T16:57:51.263433Z","submitted_at":"2023-12-06T17:49:57Z","title":"MotionCtrl: A Unified and Flexible Motion Controller for Video Generation","version":2},"cited_work":{"arxiv_id":"2312.03641","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.03641","snapshot_observed_at":"2026-07-03T15:58:37.428579Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"85460978-8830-44ec-bf8d-c03ec4094031","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2312.03641","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:663ef05a8ecf24d5276661dd45b65e3a2783609668d7eb6f3d2d6ecdde269a33","observation_id":"0bc50454-2f11-47b6-9076-0a8dcb8afc88","resolution":{"observed_at":"2026-05-22T17:51:54.841966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:e20dd28add07432e809dafcd80efb2861f4cf2c7f190b658f6ab13c69e2ef45f","observation_id":"73b59f7e-4d16-4bf8-88d6-34155074e6f9","resolution":{"observed_at":"2026-05-22T17:51:54.858160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":"f9db840d-2cf4-43bd-b76d-79a9cb5333d8","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:6bfab59616df846f7c1fab10df9da79234b07a19124df2744a67e3aa3577c862","observation_id":"f158c4d4-98bd-4695-90fb-4365ecdfec7f","resolution":{"observed_at":"2026-05-22T17:51:55.707392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01407","last_updated":"2024-12-03T13:14:39Z","snapshot_observed_at":"2026-07-06T20:00:09.775334Z","submitted_at":"2024-12-02T11:50:35Z","title":"HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2412.01407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Holodrive: Holistic 2d-3d multi-modal street scene generation for au- tonomous driving","venue":null,"work_id":"e55ec8e7-0b51-4406-86d0-d78fcc244376","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2412.01407","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:2956406ee40b6de0678ac04261f824923418f6e6beb35440622e01373093d007","observation_id":"d58622e9-9e7a-440e-88fe-fc603282ba8e","resolution":{"observed_at":"2026-05-22T17:51:54.808604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16498","last_updated":"2023-11-27T18:32:31Z","snapshot_observed_at":"2026-07-06T16:53:35.776613Z","submitted_at":"2023-11-27T18:32:31Z","title":"MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model","version":1},"cited_work":{"arxiv_id":"2311.16498","doi":"10.48550/arxiv.2311.16498","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.16498","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"H.; Yan, H.; Liu, J.-W.; Zhang, C.; Feng, J.; and Shou, M","venue":"arXiv (Cornell University)","work_id":"39c0a742-4aa6-4a68-85ab-bdac4378221a","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2311.16498","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:f55050032ff9d766d9e90029ec6bb6b2486c94ecd7d811ffcc4e4db7ff51cba6","observation_id":"7de718de-7e76-4c42-94d2-7ed06bc78d87","resolution":{"observed_at":"2026-05-22T17:51:54.782702Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized predictive model for autonomous driving","venue":null,"work_id":"ec4cb80c-84fb-4dac-8133-10160efe2384","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:d009d6e70666a2fcdf458667afa6bd2eeb7393a0623f5a9df6a505ba012c5c13","observation_id":"7d68fed2-b484-497f-b20e-96e02b410bd2","resolution":{"observed_at":"2026-05-22T17:51:55.624206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03162","last_updated":"2024-05-06T05:37:20Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T16:30:57Z","title":"Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion","version":2},"cited_work":{"arxiv_id":"2402.03162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.03162","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct-a-video: Customized video generation with user- directed camera movement and object motion","venue":null,"work_id":"4fbe5839-167a-4dd0-b026-9a34820061d1","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2402.03162","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:207d04c3c0a7ceea82911db53d58aec28d5cd543f9c9ef46c06e79e607513406","observation_id":"94971878-04fb-4fb9-bcc3-05149c91ada5","resolution":{"observed_at":"2026-05-22T17:51:54.818791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08410","last_updated":"2024-12-13T02:05:34Z","snapshot_observed_at":"2026-07-06T20:05:18.939982Z","submitted_at":"2024-12-11T14:29:35Z","title":"Physical Informed Driving World Model","version":2},"cited_work":{"arxiv_id":"2412.08410","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08410","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Physical informed driving world model","venue":null,"work_id":"77ea2101-2312-4533-b0c9-e883a7aa5f24","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2412.08410","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:4e2ac40b83317abe406f2d19bbb961813edd8b29c0db74273027270b6abb34d3","observation_id":"3afa36f0-f4de-441e-aba1-ea4e330d1edf","resolution":{"observed_at":"2026-05-22T17:51:54.799714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03689","last_updated":"2025-03-05T17:31:45Z","snapshot_observed_at":"2026-07-06T20:47:19.219786Z","submitted_at":"2025-03-05T17:31:45Z","title":"DualDiff+: Dual-Branch Diffusion for High-Fidelity Video Generation with Reward Guidance","version":1},"cited_work":{"arxiv_id":"2503.03689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03689","snapshot_observed_at":"2026-06-29T08:33:14.900531Z","title":"Dualdiff+: Dual-branch diffusion for high-fidelity video generation with reward guidance","venue":null,"work_id":"d6f8e2cf-a112-4f9f-a78b-cad443010cf6","year":2025},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2503.03689","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:bb154738af9be2abe5a1aab6369eaa2fd2354fc271bae7f2e9e5e1105d2b0b48","observation_id":"801166b3-6b6c-4024-a079-cdb183fdeacc","resolution":{"observed_at":"2026-05-22T17:51:54.824683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:2f83537e62fba511006664cf30acce42b3ccac541b341bba19a66838a4ddd2c4","observation_id":"5dde0b73-79c5-4e1e-86dc-c6f04b31c9ec","resolution":{"observed_at":"2026-05-22T17:51:54.765763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:4e34cfa649a5bb03aeca24de243012bda33e8d130fc367eaaebd598a14654360","observation_id":"2b4efeb3-3710-472b-bcca-355e780d0970","resolution":{"observed_at":"2026-05-22T17:51:54.617932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":"2311.04145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-07-04T14:59:56.012796Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","venue":"cs.CV","work_id":"aa5d5317-9965-4f23-ba7e-8e2941e66385","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:26056382df608f8868aa525a9cbf07aeb029e4ab18c584931f6a35b167a118fc","observation_id":"8d71349b-c8b2-42be-81e0-22e27f9b35f9","resolution":{"observed_at":"2026-05-22T17:51:54.667776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05679","last_updated":"2025-04-30T13:43:51Z","snapshot_observed_at":"2026-08-04T05:35:49.863354Z","submitted_at":"2024-07-08T07:26:08Z","title":"BEVWorld: A Multimodal World Simulator for Autonomous Driving via Scene-Level BEV Latents","version":3},"cited_work":{"arxiv_id":"2407.05679","doi":"10.48550/arxiv.2407.05679","metadata_source":"pith","pith_arxiv_id":"2407.05679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bevworld: A multimodal world model for au- tonomous driving via unified bev latent space","venue":"cs.CV","work_id":"60928c6c-46ff-4be9-9268-fa668e5f3817","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2407.05679","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:ad7e246aa6c3c710e36f61675d1a78e2d320eef4684d57097545c7c59ded34e0","observation_id":"1cccbd39-bc8c-4c80-90d8-2c935b78d819","resolution":{"observed_at":"2026-05-22T17:51:54.852710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.947206+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.947206+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13077","last_updated":"2023-05-22T14:48:53Z","snapshot_observed_at":"2026-07-06T15:30:42.173342Z","submitted_at":"2023-05-22T14:48:53Z","title":"ControlVideo: Training-free Controllable Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2305.13077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13077","snapshot_observed_at":"2026-07-04T17:40:00.876998Z","title":"the words ‘KEEP OFF THE GRASS","venue":null,"work_id":"31856993-b01c-4e20-8380-fae90b49a405","year":2023},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2305.13077","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:08421b2827c2068f7901e7cc54e8aa90e6eb5a73fbdc100389cdb551f3434a43","observation_id":"df02ffec-6c20-4990-8811-a3ce28a0ec0c","resolution":{"observed_at":"2026-05-22T17:51:54.771490Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13571","last_updated":"2024-11-25T07:02:47Z","snapshot_observed_at":"2026-07-06T19:35:17.363851Z","submitted_at":"2024-10-17T14:07:46Z","title":"DriveDreamer4D: World Models Are Effective Data Machines for 4D Driving Scene Representation","version":3},"cited_work":{"arxiv_id":"2410.13571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13571","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drivedreamer4d: World models are effective data machines for 4d driving scene rep- resentation","venue":null,"work_id":"5f6133e1-69eb-4e7d-85af-cf7474b854cb","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2410.13571","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:8e2545ed042962c6eb17fee8c6c54b95b0a7b6b92d56b3d50eab419e13c0f61c","observation_id":"ef19212a-3077-4516-81d1-4350fbb91e2c","resolution":{"observed_at":"2026-05-22T17:51:54.612535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Occworld: Learning a 3d occupancy world model for autonomous driving","venue":null,"work_id":"b9dd48a5-dedd-4fbc-9931-384af64f0d36","year":2024},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:4fb9a791bc1b0ddeea75d17b539317a17bfb5dfecb894447ed6ae4ddbfe51973","observation_id":"23b7e69b-3d9e-4871-9b59-d16d1b9c8b6b","resolution":{"observed_at":"2026-05-22T17:51:55.620489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14729","last_updated":"2025-08-13T09:10:30Z","snapshot_observed_at":"2026-08-02T16:02:02.988357Z","submitted_at":"2025-01-24T18:59:51Z","title":"HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2501.14729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14729","snapshot_observed_at":"2026-07-01T06:55:28.848054Z","title":"Hermes: A unified self-driving world model for simultaneous 3d scene understanding and generation","venue":null,"work_id":"5aa3c3ee-e31f-4748-b510-3cced0c9c63b","year":2025},"citing_paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-22T17:50:59.797593Z"},"links":{"cited_paper":"/paper/2501.14729","citing_paper":"/paper/2504.18576"},"observation_digest":"sha256:bfbf3ebaceccf5195c072231915d51ccc9d7beab3b68de275572b3e0add12fd1","observation_id":"75f21f86-2e9c-42ab-99f9-997a204bf329","resolution":{"observed_at":"2026-05-22T17:51:54.830399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18576","last_updated":"2026-04-24T20:54:23Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-22T20:58:22Z","title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":41,"verified_fuzzy":33},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 1 inbound Pith citation observation for arXiv:2504.18576."}