Pith. sign in

Paper Citation Record · LEDGER

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2607.05133.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.05133 v1

Coverage vector

measured 65 of 65 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-11T08:19:04.131379Z

measured 65 of 65 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

65 of 65 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved65
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7b361df2-a5c4-4f6f-b9a7-effb4aea65e2 · outbound

This paper cites Planning-oriented autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Planning-oriented autonomous driving

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:93636844115dc9a108ee43a27a70bb889f39943fb61114c01678b7e98d71a0a0

Observation 60566461-5abb-49d5-9240-1e8b21008ef9 · outbound

This paper cites Transfuser: Imitation with transformer-based sensor fusion for autonomous driving.IEEE transactions on pattern analysis and machine intelligence, 45(11):12878–12895, 2022.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Transfuser: Imitation with transformer-based sensor fusion for autonomous driving.IEEE transactions on pattern analysis and machine intelligence, 45(11):12878–12895, 2022

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:e520f1c40b0ddba6cf3360c418f928b094372887a59cf49bff905e47ee3a2469

Observation 8ba7632e-7268-484d-9f79-2b91df255131 · outbound

This paper cites Diffusiondrive: Truncated diffusion model for end-to-end autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Diffusiondrive: Truncated diffusion model for end-to-end autonomous driving

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:6679e9af9aebdd1142afa98ca8b861dc376aba6cc9cef157cdcfef6fa4d85b41

Observation 44b7402b-5903-4d5f-9db8-babb7b5d16b4 · outbound

This paper cites World Action Models are Zero-shot Policies.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation World Action Models are Zero-shot Policies

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:973a065dde774b603cdf1e6605c89109a5b6a24994da513612e13d9f691fb117

Observation 313fc146-3381-4a64-8740-c4f7cb2786bb · outbound

This paper cites A path towards autonomous machine intelligence version 0.9.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation A path towards autonomous machine intelligence version 0.9

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:9faaf0239e6087487634cf75fe54fe98e5da2d25d5ee4a9fe2385d4817f91bf7

Observation f45d7ce1-d311-42b1-9a30-a72dcf2c9b12 · outbound

This paper cites World Models.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation World Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:d0b870389e9c5e1ebd78b4e89c3666f43cce19e294ad4d60558d1be76fe5d67c

Observation 72a9f0f3-048c-47be-bb44-e253796fa4ec · outbound

This paper cites Genad: Generative end-to-end autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Genad: Generative end-to-end autonomous driving

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:745fdfb814a873ede37e668266e68154b7b666af06629e8c1aeb85bb070abb90

Observation 768aa29c-09db-4038-a4cc-9611087c9f1c · outbound

This paper cites Dreamgen: Unlocking generalization in robot learning through video world models.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Dreamgen: Unlocking generalization in robot learning through video world models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:9aa1384ebe6f2438aac3b88287beaaeceebd91a941960d0f2d75f97c73465e1e

Observation 612d2847-c5ee-4e1d-adaf-cafd8763b5b2 · outbound

This paper cites Causal World Modeling for Robot Control.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Causal World Modeling for Robot Control

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:90d1f687e8d54a857a39586bc9c848ed15a632142d944f5c35c8873b926bcb92

Observation bdb8a4ae-cf39-47d6-8048-08d2a24cda1a · outbound

This paper cites Unified Video Action Model.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Unified Video Action Model

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:67cfe5d76691e9b27ac1bdfa5f5fe8b237b6495e9ecc78c2533a5dfba0bace12

Observation 05574959-853a-4d62-a4a2-394dc4ac1f9c · outbound

This paper cites Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:d68f08c2c4d466201b8133eb810a4fa4db6de2aabd7d02d211ae6536377fdf6d

Observation 6dbd57fd-f0c7-482b-941b-a23371b42581 · outbound

This paper cites Fast-WAM: Do World Action Models Need Test-time Future Imagination?.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Fast-WAM: Do World Action Models Need Test-time Future Imagination?

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:3894edbcd3818afc2e1e9bc45b44288cafd3c7b9d6b9cdadc742df4ab5c39dbd

Observation 9f1efbe1-9ffb-4e8a-898d-9ae2024cceae · outbound

This paper cites Imagidrive: A unified imagination-and-planning framework for autonomous driving.arXiv preprint arXiv:2508.11428, 2025.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Imagidrive: A unified imagination-and-planning framework for autonomous driving.arXiv preprint arXiv:2508.11428, 2025

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:4278ac9d7e4b30ebe012e1598cb709b090c6e869bfb3e0e2ce6a8ed2fad708a7

Observation 07079a8a-bacb-4af4-9869-872674882e70 · outbound

This paper cites DriveVA: Video Action Models are Zero-Shot Drivers.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation DriveVA: Video Action Models are Zero-Shot Drivers

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:8c1c35605fc757a0459a34fa2b2afbc85fddb0b29d134f1e51c1144de1585e73

Observation eb1cde90-1e30-4f08-8cc9-c4a655ce2d6d · outbound

This paper cites Gigaworld-policy: An efficient action-centered world–action model.arXiv preprint arXiv:2603.17240, 2026.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Gigaworld-policy: An efficient action-centered world–action model.arXiv preprint arXiv:2603.17240, 2026

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:6736bc299e2394d8aade04a73d0cb07cb28d502dd42f0e96a4a58b885718cb60

Observation cd9f61eb-a9c5-4a07-a724-9993149039d9 · outbound

This paper cites ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:d7c949acab7631ce8bdfd2e07a3007aaf95748a1271bf601656ee41cf97035c5

Observation 05274d57-664e-43af-a525-1fbf0b152902 · outbound

This paper cites mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:cd2f17c65dcfd6017c3307c9a14ac5e5a0b99e40db0d822232785dc9f4752ce4

Observation 20330b21-ba23-4a95-b84e-11642a2fc275 · outbound

This paper cites Video Generators are Robot Policies.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Video Generators are Robot Policies

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:f27333ad6e385a00fae5e01267e7e16ac74c685a6fac956ca571f1b1b4d96bd1

Observation c90ea10d-1188-4425-bcd0-328815bbe223 · outbound

This paper cites Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:d2d5c452fb05efdb44821adffb8a48ff0471e86585b95e04010ac2b013172dde

Observation 7bd410ac-8e3c-45c8-ae4a-c75c1791f37e · outbound

This paper cites Large Video Planner Enables Generalizable Robot Control.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Large Video Planner Enables Generalizable Robot Control

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:f0a72afea0be282f0b5f79420c4ac11c69cc8c9c8708a2f0560ab3db69f88ce5

Observation 28578f82-77e5-49d8-9b62-a7266f1eee40 · outbound

This paper cites Scalable diffusion models with transformers.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Scalable diffusion models with transformers

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:a2eb2aa0eec3517480895a1ef3413f3ade1559972a753be3e6d628cfd1ed61dc

Observation 3d2c49e2-5f48-40c0-993c-b9314e9ac0ae · outbound

This paper cites Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:87eaaa56536885490507855e17ee2dc186d4289cd29e2838c260e9e69ba86f9a

Observation fab1e1ff-8f62-495c-b8cf-8d79cfbfd3ec · outbound

This paper cites Drivegan: Towards a controllable high-quality neural simulation.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Drivegan: Towards a controllable high-quality neural simulation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:3549850acb56edf492a9aa769769f44cfa36c5fbea245a5c9bed13952f23c229

Observation 0b5fe724-da19-45d0-ad01-f21291e557b6 · outbound

This paper cites MagicDrive: Street View Generation with Diverse 3D Geometry Control.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation MagicDrive: Street View Generation with Diverse 3D Geometry Control

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:401507dcc0b2b456e0ecdbf685dd40fed248eda784ef46f7f08d731383021414

Observation 8b6cd6eb-4959-4952-a32a-689b31a7ffa6 · outbound

This paper cites Drivedreamer: Towards real-world-drive world models for autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Drivedreamer: Towards real-world-drive world models for autonomous driving

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:61271fc6a7deb4e16445d180fe2bc6579b7c143abe281163a0977425a9863e66

Observation 35ba3ee8-1afc-458a-a436-bcc13f6830d3 · outbound

This paper cites Drivedreamer-2: Llm-enhanced world models for diverse driving video generation.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Drivedreamer-2: Llm-enhanced world models for diverse driving video generation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:38272ec10087196111bd8f9c1af789f019d50358ef3854e0cc80302f24d79077

Observation 0c086a69-0f0a-44a3-8802-645e587dd52f · outbound

This paper cites Panacea: Panoramic and controllable video generation for autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Panacea: Panoramic and controllable video generation for autonomous driving

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:8c68b4f8599185cca4be16492fca4ba92ca0e7bec442d12fe927537d1080ed62

Observation d01ae7fc-da41-4394-aa00-f0df80a905f3 · outbound

This paper cites Vista: A generalizable driving world model with high fidelity and versatile controllability.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Vista: A generalizable driving world model with high fidelity and versatile controllability

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:12de58b9613c107fbe6c68fda8109721b57d98b936fb8ab1af1bad95c742bd3f

Observation b90848e2-4eec-4d87-8770-04882689d2f9 · outbound

This paper cites GAIA-1: A Generative World Model for Autonomous Driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation GAIA-1: A Generative World Model for Autonomous Driving

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:056da9cc8afa597d7f9320d9a0cbb51a941e513d09ff290412ef8911f527b13d

Observation 230b496f-f725-4893-bf88-4db994804733 · outbound

This paper cites GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving

Reference 32

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:ce02a95179be1618ff2f0585f7d7e6bf9f3aafb1abaf393bb923c529f07f4b6b

Observation 36c25b09-0608-4832-ad1e-5044730fdfbb · outbound

This paper cites Magicdrive-v2: High- resolution long video generation for autonomous driving with adaptive control.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Magicdrive-v2: High- resolution long video generation for autonomous driving with adaptive control

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:e006c00f8e991aa7a2cd2b9018f4e77c2df3db9419be3d2ec211a64dd9fdc63e

Observation 62af673d-4d06-4883-a2cc-f6169e189350 · outbound

This paper cites MiLA: Multi-view Intensive-fidelity Long-term Video Generation World Model for Autonomous Driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation MiLA: Multi-view Intensive-fidelity Long-term Video Generation World Model for Autonomous Driving

Reference 34

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:5a208220979bed3e991fb0607322dd7a1cedf7bfe207bc2098f288b17dc4d054

Observation 3b70a9ca-5aea-4e99-be2b-1b03a632fb70 · outbound

This paper cites CoGen: 3D Consistent Video Generation via Adaptive Conditioning for Autonomous Driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation CoGen: 3D Consistent Video Generation via Adaptive Conditioning for Autonomous Driving

Reference 35

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:39f3f23116bd9cee2956ee039353095b098b0629ae1ad63f68b3634e9c1a644f

Observation dceccfac-7cfb-4f7f-9062-8aa62f9a58a0 · outbound

This paper cites Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:1d5807bf9ccb0449fd42cc5aaeb5b60ca8bde49c5426a10e484174a87b1ef2e1

Observation d1628af3-107a-4f24-b6c7-cba92d7196e8 · outbound

This paper cites OmniNWM: Omniscient Driving Navigation World Models.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation OmniNWM: Omniscient Driving Navigation World Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:4e9fd784160a121b97ee2c26e67ac0e36894b9ca5b4a610e2ffab146e5822ce4

Observation a9a8d2d7-32a5-42c1-9a84-eafa8bbf029c · outbound

This paper cites Occworld: Learning a 3d occupancy world model for autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Occworld: Learning a 3d occupancy world model for autonomous driving

Reference 38

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:33dd086f034b729ff8b23aa7ff54944b37aa2b85cade5dc4b8680926394f6b21

Observation 7fafc4b6-9aa3-4fad-b26c-56e9d8e6f851 · outbound

This paper cites Driveworld: 4d pre-trained scene understanding via world models for autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Driveworld: 4d pre-trained scene understanding via world models for autonomous driving

Reference 39

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:d1e13ddc931fcec8292d6e27d25ec9777ec8e6a61ff3367bc11ac141365e348e

Observation 68ca223f-0f8f-4af5-9abd-6e3415aa9a5d · outbound

This paper cites DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT

Reference 40

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:806cc476eefbfa9ac45cda116d2a3af94c538ae6c5c4339f5d9679bf66c5b4bf

Observation 8f676f42-65e2-49d7-940c-fe548dc416c3 · outbound

This paper cites Wovogen: World volume-aware diffusion for controllable multi-camera driving scene generation.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Wovogen: World volume-aware diffusion for controllable multi-camera driving scene generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:3ddfdd31bb56c1555399f03f11a687079a432e7239d50106fb57fcd7949e3649

Observation b7541b17-8d2f-41b5-a04e-3f51047ccfff · outbound

This paper cites Uniscene: Unified occupancy-centric driving scene generation.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Uniscene: Unified occupancy-centric driving scene generation

Reference 42

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:3d9d92dcecbd99402d93524ab200e85f4683594e06a99416b8d066dcb8bb0a6d

Observation ad49560b-9c9e-4f80-9dba-6ac328350aed · outbound

This paper cites Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving

Reference 43

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:00f759a4023737716c9b176f40d3965fa29cc0817cc5c2ba6b3f2c459e4c730c

Observation 0b4ebf3c-0713-48cc-9ccc-8764314cf555 · outbound

This paper cites Drivinggpt: Unifying driving world modeling and planning with multi-modal autoregressive transformers.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Drivinggpt: Unifying driving world modeling and planning with multi-modal autoregressive transformers

Reference 44

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:f55d9c33549fd303593e719ea791a018b56bee17d31bb39cffde3516b47c0702

Observation e8c6bc98-0215-4466-9984-14ea1b0c8fbc · outbound

This paper cites Enhancing End-to-End Autonomous Driving with Latent World Model.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Enhancing End-to-End Autonomous Driving with Latent World Model

Reference 45

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:9f304090439a60c6776891b23597d551932cba08679f136f095ca879df2c984a

Observation 970279fa-9661-4d3d-81d5-12354fd65a5f · outbound

This paper cites Doe-1: Closed-Loop Autonomous Driving with Large World Model.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Doe-1: Closed-Loop Autonomous Driving with Large World Model

Reference 46

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:fac16fe975100c61a511d68fc0c5c0fee13945655f6598eb1004fe0372c848c1

Observation d1078172-1ab7-4ef2-b787-6937f5af58c7 · outbound

This paper cites ReSim: Reliable World Simulation for Autonomous Driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation ReSim: Reliable World Simulation for Autonomous Driving

Reference 47

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:113ea30a56a19081610e1ac20f8129c18822888bd4ef56d4eb7c991ec85ef495

Observation 62a3f43f-016d-4447-878e-8afc2436482c · outbound

This paper cites End-to-End Driving with Online Trajectory Evaluation via BEV World Model.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation End-to-End Driving with Online Trajectory Evaluation via BEV World Model

Reference 48

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:91b26cd28e75af33c90904534e0313852cb65ab20dff123de38af8ae2835ce82

Observation 842e1405-76c4-4e7b-86cf-882f1733e636 · outbound

This paper cites DriveLaW:Unifying Planning and Video Generation in a Latent Driving World.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation DriveLaW:Unifying Planning and Video Generation in a Latent Driving World

Reference 49

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:2371eb92d68a98adeb5bd87e5f56cee10229a7216ab0025c41062e558a46fa14

Observation a3e06c47-43e5-4e9d-ab72-9204a8410b44 · outbound

This paper cites Epona: Autoregressive Diffusion World Model for Autonomous Driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Epona: Autoregressive Diffusion World Model for Autonomous Driving

Reference 50

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:7ebb35ea5c26b0bbd044234342a43dc96398b7a8cbb86ce982ced912d02c61b2

Observation bcb5c186-ebf4-49cb-8e6f-4d2fd249ab05 · outbound

This paper cites From forecasting to planning: Policy world model for collaborative state-action prediction.arXiv preprint arXiv:2510.19654, 2025.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation From forecasting to planning: Policy world model for collaborative state-action prediction.arXiv preprint arXiv:2510.19654, 2025

Reference 51

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:75fd3a57fb4fdc801bbfcf69b66d021ced9bdf35d8563db9fb0a0c734d4a3ee0

Observation 5edf131b-c9cd-4d5b-a222-47cb42ec359d · outbound

This paper cites DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving

Reference 52

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:21e5d9e6e85a39933c20e0c2ec731859994a205a0fb0b74a18dd93ae1ce7d75f

Observation 92e2cf21-f064-4461-9b76-d8e79d7e64a8 · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Wan: Open and Advanced Large-Scale Video Generative Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:30784ca4b833d548a0455a9d80e5764ce238268a9e61bb3cb17c7a981b2b6603

Observation d41904ea-d844-4b86-8bd4-5a44d0574378 · outbound

This paper cites Videovla: Video generators can be generalizable robot manipulators.arXiv preprint arXiv:2512.06963, 2025.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Videovla: Video generators can be generalizable robot manipulators.arXiv preprint arXiv:2512.06963, 2025

Reference 54

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:4a4f14d8a7b4a3596ade1576e9fcde8bd48fa406ce2f7b79abf23b82bef965ca

Observation cf684bf8-a91f-4979-8206-aa4500b2a3ac · outbound

This paper cites Navsim: Data-driven non-reactive autonomous vehicle simulation and benchmarking.Advances in Neural Information Processing Systems, 37:28706– 28719, 2024.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Navsim: Data-driven non-reactive autonomous vehicle simulation and benchmarking.Advances in Neural Information Processing Systems, 37:28706– 28719, 2024

Reference 55

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:44f0ed6fbcbc2ce3643772d6a89c6d19bfbb86aae713050388e148f9e97029f4

Observation 73ad8794-bbbf-4445-a686-7ac3962e7832 · outbound

This paper cites Openscene: The largest up-to-date 3d occupancy prediction benchmark in autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Openscene: The largest up-to-date 3d occupancy prediction benchmark in autonomous driving

Reference 56

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:41a991b5fa484a0115bdeabcbf92384bb49a4c4bca2b7bbeded7e58cd532993f

Observation 0f037c17-8f0a-49e7-8d2e-afb07817889c · outbound

This paper cites nuscenes: A multimodal dataset for autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation nuscenes: A multimodal dataset for autonomous driving

Reference 57

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:66091c2fa8d501f62df58b3894c06cea3d3cd943a3df811146954932aaa8f762

Observation 4a33f046-15da-47a7-95e0-d291574a6c76 · outbound

This paper cites Vad: Vectorized scene representation for efficient autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Vad: Vectorized scene representation for efficient autonomous driving

Reference 58

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:a4816f215a2393ebd603e742a497a6fea4e62c32e50804f5761398ca5bc75b29

Observation c9c09736-9a76-4e90-84ad-b9001be9a609 · outbound

This paper cites Bench2drive: Towards multi- ability benchmarking of closed-loop end-to-end autonomous driving.Advances in Neural Information Processing Systems, 37:819–844, 2024.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Bench2drive: Towards multi- ability benchmarking of closed-loop end-to-end autonomous driving.Advances in Neural Information Processing Systems, 37:819–844, 2024

Reference 59

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:d171c77e2ecd4eeff66cecad73f0e785e43d7f2f3480474351db74dffc3c05cb

Observation f3ce3c71-f2b5-4348-b57a-e88130e91e7b · outbound

This paper cites Carla: An open urban driving simulator.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Carla: An open urban driving simulator

Reference 60

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:c03392c357e56319c60ddf1aa73136d269da3cb8f62bb50d93b3dc9e986c67e6

Observation e0ce91d7-6e1a-4b9d-a579-37e4e35eba6b · outbound

This paper cites How simulation helps autonomous driving: A survey of sim2real, digital twins, and parallel intelligence.IEEE Transactions on Intelligent Vehicles, 9(1):593–612, 2023.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation How simulation helps autonomous driving: A survey of sim2real, digital twins, and parallel intelligence.IEEE Transactions on Intelligent Vehicles, 9(1):593–612, 2023

Reference 61

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:14ee1ecd2f04a7c433cf580f8e93bddb8756f9fcb72c827c9c69ffe63b0a6beb

Observation da365fa5-ac7a-49f9-9d90-4905ed63ecc2 · outbound

This paper cites V ADv2: End-to-end autonomous driving via probabilistic planning.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation V ADv2: End-to-end autonomous driving via probabilistic planning

Reference 62

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:77dc8952d60318400c632cfd7fdd6f7fb267084660f86e6dc1bea8922946bffb

Observation bafd97d5-f5d8-4bcf-b11d-e44dff33b11a · outbound

This paper cites Para-drive: Parallelized architecture for real-time autonomous driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Para-drive: Parallelized architecture for real-time autonomous driving

Reference 63

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:d1e0799370f17a7b63b3bb0e4b4baa4c6a43d75512075092553114e83f43f45d

Observation 970a7fa9-8f55-41de-a1ac-c34374473589 · outbound

This paper cites ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving

Reference 64

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:9c1148e4d931f9969b2f8b68c4d6f06e63b7e1e3198208473e244aeb2c9a1f25

Observation 08c2c3cc-6762-4f0e-8f67-b4423a3dc562 · outbound

This paper cites Deep patch visual odometry.Advances in Neural Information Processing Systems, 36:39033–39051, 2023.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Deep patch visual odometry.Advances in Neural Information Processing Systems, 36:39033–39051, 2023

Reference 65

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:bc3a9e539ebd16a3a4ecf1579d39d6c81b872b12be6f0a194e289a134c8199eb

Observation 33980d71-31ed-48ae-a7e4-503c0cc94b75 · outbound

This paper cites St-p3: End-to- end vision-based autonomous driving via spatial-temporal feature learning.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation St-p3: End-to- end vision-based autonomous driving via spatial-temporal feature learning

Reference 66

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:ec8a0393e3011e40a750df0943127f8fa87831a09dbc88851b325812e228bf3d

Observation f0e3c0cb-cee3-485a-8959-0e2904bf209d · outbound

This paper cites Scene as occupancy.

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Scene as occupancy

Reference 67

Resolution
unresolved
no resolver link, observed 2026-07-11T08:19:04.131379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T08:19:04.131379Z digest=sha256:f0524e1a24a841c0c4a42f21b087cb2460d2f6b0aa2f89725bb67914702c811c

Pith citing papers

No inbound Pith citation observations are available.