{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:ILGD3JUL4B3N6EI7YBH5S27NDX","short_pith_number":"pith:ILGD3JUL","schema_version":"1.0","canonical_sha256":"42cc3da68be076df111fc04fd96bed1dd407eb7184bf42993b4f96fd7b278143","source":{"kind":"arxiv","id":"2412.18607","version":1},"attestation_state":"computed","paper":{"title":"DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Yuntao Chen, Yuqi Wang, Zhaoxiang Zhang","submitted_at":"2024-12-24T18:59:37Z","abstract_excerpt":"World model-based searching and planning are widely recognized as a promising path toward human-level physical intelligence. However, current driving world models primarily rely on video diffusion models, which specialize in visual generation but lack the flexibility to incorporate other modalities like action. In contrast, autoregressive transformers have demonstrated exceptional capability in modeling multimodal data. Our work aims to unify both driving model simulation and trajectory planning into a single sequence modeling problem. We introduce a multimodal driving language based on interl"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.18607","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-12-24T18:59:37Z","cross_cats_sorted":[],"title_canon_sha256":"64366bb56a41e352faa9b062af6e01d862c1cd659241fb4a450e546073738cf3","abstract_canon_sha256":"9e8888fcd20b3b3ed60ee7efa93c3ce95ce54b5336e03d6f411016e2011360b2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:53:58.134636Z","signature_b64":"93aHtEEOXIjFFM+dZ0jDDn9JE5JjRVfUBX8QTblWvMEhUIow2r83WZy4Hz0rXB2BHoQ5Hy37U/g7a8/BY9/9AQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"42cc3da68be076df111fc04fd96bed1dd407eb7184bf42993b4f96fd7b278143","last_reissued_at":"2026-07-05T09:53:58.134161Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:53:58.134161Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Yuntao Chen, Yuqi Wang, Zhaoxiang Zhang","submitted_at":"2024-12-24T18:59:37Z","abstract_excerpt":"World model-based searching and planning are widely recognized as a promising path toward human-level physical intelligence. However, current driving world models primarily rely on video diffusion models, which specialize in visual generation but lack the flexibility to incorporate other modalities like action. In contrast, autoregressive transformers have demonstrated exceptional capability in modeling multimodal data. Our work aims to unify both driving model simulation and trajectory planning into a single sequence modeling problem. We introduce a multimodal driving language based on interl"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.18607","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.18607/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.18607","created_at":"2026-07-05T09:53:58.134217+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.18607v1","created_at":"2026-07-05T09:53:58.134217+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.18607","created_at":"2026-07-05T09:53:58.134217+00:00"},{"alias_kind":"pith_short_12","alias_value":"ILGD3JUL4B3N","created_at":"2026-07-05T09:53:58.134217+00:00"},{"alias_kind":"pith_short_16","alias_value":"ILGD3JUL4B3N6EI7","created_at":"2026-07-05T09:53:58.134217+00:00"},{"alias_kind":"pith_short_8","alias_value":"ILGD3JUL","created_at":"2026-07-05T09:53:58.134217+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26017","citing_title":"G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.25509","citing_title":"ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26017","citing_title":"G2DP: Diffusion Planning with Spatio-Temporal Grid Guidance","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2504.18576","citing_title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15120","citing_title":"CLOVER: Closed-Loop Value Estimation and Ranking for End-to-End Autonomous Driving Planning","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19631","citing_title":"HEAT: Heterogeneous End-to-End Autonomous Driving via Trajectory-Guided World Models","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2506.09981","citing_title":"ReSim: Reliable World Simulation for Autonomous Driving","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2510.12796","citing_title":"DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10564","citing_title":"DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving","ref_index":132,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17915","citing_title":"OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16592","citing_title":"Human Cognition in Machines: A Unified Perspective of World Models","ref_index":31,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ILGD3JUL4B3N6EI7YBH5S27NDX","json":"https://pith.science/pith/ILGD3JUL4B3N6EI7YBH5S27NDX.json","graph_json":"https://pith.science/api/pith-number/ILGD3JUL4B3N6EI7YBH5S27NDX/graph.json","events_json":"https://pith.science/api/pith-number/ILGD3JUL4B3N6EI7YBH5S27NDX/events.json","paper":"https://pith.science/paper/ILGD3JUL"},"agent_actions":{"view_html":"https://pith.science/pith/ILGD3JUL4B3N6EI7YBH5S27NDX","download_json":"https://pith.science/pith/ILGD3JUL4B3N6EI7YBH5S27NDX.json","view_paper":"https://pith.science/paper/ILGD3JUL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.18607&json=true","fetch_graph":"https://pith.science/api/pith-number/ILGD3JUL4B3N6EI7YBH5S27NDX/graph.json","fetch_events":"https://pith.science/api/pith-number/ILGD3JUL4B3N6EI7YBH5S27NDX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ILGD3JUL4B3N6EI7YBH5S27NDX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ILGD3JUL4B3N6EI7YBH5S27NDX/action/storage_attestation","attest_author":"https://pith.science/pith/ILGD3JUL4B3N6EI7YBH5S27NDX/action/author_attestation","sign_citation":"https://pith.science/pith/ILGD3JUL4B3N6EI7YBH5S27NDX/action/citation_signature","submit_replication":"https://pith.science/pith/ILGD3JUL4B3N6EI7YBH5S27NDX/action/replication_record"}},"created_at":"2026-07-05T09:53:58.134217+00:00","updated_at":"2026-07-05T09:53:58.134217+00:00"}