{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:4GRUYRTKYJ4OOM4H426DJAY62C","short_pith_number":"pith:4GRUYRTK","schema_version":"1.0","canonical_sha256":"e1a34c466ac278e73387e6bc34831ed0ae92a6af7069bbdef0677d86251a851e","source":{"kind":"arxiv","id":"2501.14729","version":3},"attestation_state":"computed","paper":{"title":"HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dingkang Liang, Dingyuan Zhang, Feiyang Tan, Hengshuang Zhao, Sifan Tu, Xiang Bai, Xin Zhou, Xiwu Chen, Yikang Ding","submitted_at":"2025-01-24T18:59:51Z","abstract_excerpt":"Driving World Models (DWMs) have become essential for autonomous driving by enabling future scene prediction. However, existing DWMs are limited to scene generation and fail to incorporate scene understanding, which involves interpreting and reasoning about the driving environment. In this paper, we present a unified Driving World Model named HERMES. We seamlessly integrate 3D scene understanding and future scene evolution (generation) through a unified framework in driving scenarios. Specifically, HERMES leverages a Bird's-Eye View (BEV) representation to consolidate multi-view spatial inform"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.14729","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-01-24T18:59:51Z","cross_cats_sorted":[],"title_canon_sha256":"fecd5ba2820f1cc52886526f8a4ee334975d36c7e734d0e98d53a1bb3335a5a5","abstract_canon_sha256":"84cdf22bbe27796c2b1a2f95cc0a6381c5930e2c77b0194843d79f8dd089ee68"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:52:59.090469Z","signature_b64":"DYHMfYTdiUitHLqenhVvzN/lgVo4xvC46RdVIYcXB8PQ/H5d4lOaR6f4TJ1qJqIeyOLRdxk8jLcnyCT1RmfiAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e1a34c466ac278e73387e6bc34831ed0ae92a6af7069bbdef0677d86251a851e","last_reissued_at":"2026-07-05T11:52:59.090019Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:52:59.090019Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dingkang Liang, Dingyuan Zhang, Feiyang Tan, Hengshuang Zhao, Sifan Tu, Xiang Bai, Xin Zhou, Xiwu Chen, Yikang Ding","submitted_at":"2025-01-24T18:59:51Z","abstract_excerpt":"Driving World Models (DWMs) have become essential for autonomous driving by enabling future scene prediction. However, existing DWMs are limited to scene generation and fail to incorporate scene understanding, which involves interpreting and reasoning about the driving environment. In this paper, we present a unified Driving World Model named HERMES. We seamlessly integrate 3D scene understanding and future scene evolution (generation) through a unified framework in driving scenarios. Specifically, HERMES leverages a Bird's-Eye View (BEV) representation to consolidate multi-view spatial inform"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.14729","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.14729/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.14729","created_at":"2026-07-05T11:52:59.090073+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.14729v3","created_at":"2026-07-05T11:52:59.090073+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.14729","created_at":"2026-07-05T11:52:59.090073+00:00"},{"alias_kind":"pith_short_12","alias_value":"4GRUYRTKYJ4O","created_at":"2026-07-05T11:52:59.090073+00:00"},{"alias_kind":"pith_short_16","alias_value":"4GRUYRTKYJ4OOM4H","created_at":"2026-07-05T11:52:59.090073+00:00"},{"alias_kind":"pith_short_8","alias_value":"4GRUYRTK","created_at":"2026-07-05T11:52:59.090073+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.29879","citing_title":"LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29879","citing_title":"LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2504.18576","citing_title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","ref_index":78,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22089","citing_title":"LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2512.23180","citing_title":"GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17580","citing_title":"ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2512.13030","citing_title":"Motus: A Unified Latent Action World Model","ref_index":63,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4GRUYRTKYJ4OOM4H426DJAY62C","json":"https://pith.science/pith/4GRUYRTKYJ4OOM4H426DJAY62C.json","graph_json":"https://pith.science/api/pith-number/4GRUYRTKYJ4OOM4H426DJAY62C/graph.json","events_json":"https://pith.science/api/pith-number/4GRUYRTKYJ4OOM4H426DJAY62C/events.json","paper":"https://pith.science/paper/4GRUYRTK"},"agent_actions":{"view_html":"https://pith.science/pith/4GRUYRTKYJ4OOM4H426DJAY62C","download_json":"https://pith.science/pith/4GRUYRTKYJ4OOM4H426DJAY62C.json","view_paper":"https://pith.science/paper/4GRUYRTK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.14729&json=true","fetch_graph":"https://pith.science/api/pith-number/4GRUYRTKYJ4OOM4H426DJAY62C/graph.json","fetch_events":"https://pith.science/api/pith-number/4GRUYRTKYJ4OOM4H426DJAY62C/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4GRUYRTKYJ4OOM4H426DJAY62C/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4GRUYRTKYJ4OOM4H426DJAY62C/action/storage_attestation","attest_author":"https://pith.science/pith/4GRUYRTKYJ4OOM4H426DJAY62C/action/author_attestation","sign_citation":"https://pith.science/pith/4GRUYRTKYJ4OOM4H426DJAY62C/action/citation_signature","submit_replication":"https://pith.science/pith/4GRUYRTKYJ4OOM4H426DJAY62C/action/replication_record"}},"created_at":"2026-07-05T11:52:59.090073+00:00","updated_at":"2026-07-05T11:52:59.090073+00:00"}