{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:O2HFSJPRRCS7Z2J3XYVVNQYEC7","short_pith_number":"pith:O2HFSJPR","schema_version":"1.0","canonical_sha256":"768e5925f188a5fce93bbe2b56c30417ea58bd6768c5bc3fea94ff502e04fa4f","source":{"kind":"arxiv","id":"2412.15544","version":1},"attestation_state":"computed","paper":{"title":"VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.RO","authors_text":"Junwei You, Sikai Chen, Yansong Qu, Zihao Sheng, Zilin Huang","submitted_at":"2024-12-20T04:08:11Z","abstract_excerpt":"In recent years, reinforcement learning (RL)-based methods for learning driving policies have gained increasing attention in the autonomous driving community and have achieved remarkable progress in various driving scenarios. However, traditional RL approaches rely on manually engineered rewards, which require extensive human effort and often lack generalizability. To address these limitations, we propose \\textbf{VLM-RL}, a unified framework that integrates pre-trained Vision-Language Models (VLMs) with RL to generate reward signals using image observation and natural language goals. The core "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.15544","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2024-12-20T04:08:11Z","cross_cats_sorted":["cs.AI","cs.CV"],"title_canon_sha256":"223bcf781c5a300ccaf24d5f461d55db0d39c38a4c6969aa6912b8a3fdcf3c8f","abstract_canon_sha256":"6ce149aeac15d97d7156549c891310031a7a5ad6f1e271f98beb33c8a2fe6b67"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:52:25.030830Z","signature_b64":"c8YnWGuihVwgwxGnF6UlCNQzC9z2YKx60NuKq/ww10kkdKAzusCwC08MXSafv4NN2cGshrir+SisHC7zhqU9DQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"768e5925f188a5fce93bbe2b56c30417ea58bd6768c5bc3fea94ff502e04fa4f","last_reissued_at":"2026-07-05T09:52:25.030391Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:52:25.030391Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.RO","authors_text":"Junwei You, Sikai Chen, Yansong Qu, Zihao Sheng, Zilin Huang","submitted_at":"2024-12-20T04:08:11Z","abstract_excerpt":"In recent years, reinforcement learning (RL)-based methods for learning driving policies have gained increasing attention in the autonomous driving community and have achieved remarkable progress in various driving scenarios. However, traditional RL approaches rely on manually engineered rewards, which require extensive human effort and often lack generalizability. To address these limitations, we propose \\textbf{VLM-RL}, a unified framework that integrates pre-trained Vision-Language Models (VLMs) with RL to generate reward signals using image observation and natural language goals. The core "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.15544","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.15544/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.15544","created_at":"2026-07-05T09:52:25.030451+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.15544v1","created_at":"2026-07-05T09:52:25.030451+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.15544","created_at":"2026-07-05T09:52:25.030451+00:00"},{"alias_kind":"pith_short_12","alias_value":"O2HFSJPRRCS7","created_at":"2026-07-05T09:52:25.030451+00:00"},{"alias_kind":"pith_short_16","alias_value":"O2HFSJPRRCS7Z2J3","created_at":"2026-07-05T09:52:25.030451+00:00"},{"alias_kind":"pith_short_8","alias_value":"O2HFSJPR","created_at":"2026-07-05T09:52:25.030451+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2604.18483","citing_title":"Steadily moving semi-infinite fracture in plane poroelasticity","ref_index":40,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10974","citing_title":"Language-Driven Cost Optimization for Autonomous Driving","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11266","citing_title":"Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10436","citing_title":"SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding via Functional Structure Units","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18484","citing_title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","ref_index":40,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/O2HFSJPRRCS7Z2J3XYVVNQYEC7","json":"https://pith.science/pith/O2HFSJPRRCS7Z2J3XYVVNQYEC7.json","graph_json":"https://pith.science/api/pith-number/O2HFSJPRRCS7Z2J3XYVVNQYEC7/graph.json","events_json":"https://pith.science/api/pith-number/O2HFSJPRRCS7Z2J3XYVVNQYEC7/events.json","paper":"https://pith.science/paper/O2HFSJPR"},"agent_actions":{"view_html":"https://pith.science/pith/O2HFSJPRRCS7Z2J3XYVVNQYEC7","download_json":"https://pith.science/pith/O2HFSJPRRCS7Z2J3XYVVNQYEC7.json","view_paper":"https://pith.science/paper/O2HFSJPR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.15544&json=true","fetch_graph":"https://pith.science/api/pith-number/O2HFSJPRRCS7Z2J3XYVVNQYEC7/graph.json","fetch_events":"https://pith.science/api/pith-number/O2HFSJPRRCS7Z2J3XYVVNQYEC7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/O2HFSJPRRCS7Z2J3XYVVNQYEC7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/O2HFSJPRRCS7Z2J3XYVVNQYEC7/action/storage_attestation","attest_author":"https://pith.science/pith/O2HFSJPRRCS7Z2J3XYVVNQYEC7/action/author_attestation","sign_citation":"https://pith.science/pith/O2HFSJPRRCS7Z2J3XYVVNQYEC7/action/citation_signature","submit_replication":"https://pith.science/pith/O2HFSJPRRCS7Z2J3XYVVNQYEC7/action/replication_record"}},"created_at":"2026-07-05T09:52:25.030451+00:00","updated_at":"2026-07-05T09:52:25.030451+00:00"}