{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:4DAYUPQRZGZU6DSDT6H3IQ3ED4","short_pith_number":"pith:4DAYUPQR","schema_version":"1.0","canonical_sha256":"e0c18a3e11c9b34f0e439f8fb443641f1745fd82a1c43434ac7c9ec63fcd91ae","source":{"kind":"arxiv","id":"2307.07176","version":3},"attestation_state":"computed","paper":{"title":"SafeDreamer: Safe Reinforcement Learning with World Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.LG","authors_text":"Borong Zhang, Chunhe Xia, Jiaming Ji, Weidong Huang, Yaodong Yang","submitted_at":"2023-07-14T06:00:08Z","abstract_excerpt":"The deployment of Reinforcement Learning (RL) in real-world applications is constrained by its failure to satisfy safety criteria. Existing Safe Reinforcement Learning (SafeRL) methods, which rely on cost functions to enforce safety, often fail to achieve zero-cost performance in complex scenarios, especially vision-only tasks. These limitations are primarily due to model inaccuracies and inadequate sample efficiency. The integration of the world model has proven effective in mitigating these shortcomings. In this work, we introduce SafeDreamer, a novel algorithm incorporating Lagrangian-based"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2307.07176","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-07-14T06:00:08Z","cross_cats_sorted":["cs.AI","cs.CV"],"title_canon_sha256":"6a8e5c695425ca67a70710f1f233dd340b9ae2522bc3392508cda04eafb36983","abstract_canon_sha256":"f96be1f3defdac2737fc3bf1d739998788a5898eec7fead1ea22cf49f8d83632"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:53:16.528772Z","signature_b64":"C+E9A9hn+YwISFGb5g4A97rVR87Ss74LszwCcnPzHEWsvjQld1Up4kCnpii12EXVkgbyivmEWGyBaUlwy+mbAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e0c18a3e11c9b34f0e439f8fb443641f1745fd82a1c43434ac7c9ec63fcd91ae","last_reissued_at":"2026-07-05T08:53:16.528328Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:53:16.528328Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SafeDreamer: Safe Reinforcement Learning with World Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV"],"primary_cat":"cs.LG","authors_text":"Borong Zhang, Chunhe Xia, Jiaming Ji, Weidong Huang, Yaodong Yang","submitted_at":"2023-07-14T06:00:08Z","abstract_excerpt":"The deployment of Reinforcement Learning (RL) in real-world applications is constrained by its failure to satisfy safety criteria. Existing Safe Reinforcement Learning (SafeRL) methods, which rely on cost functions to enforce safety, often fail to achieve zero-cost performance in complex scenarios, especially vision-only tasks. These limitations are primarily due to model inaccuracies and inadequate sample efficiency. The integration of the world model has proven effective in mitigating these shortcomings. In this work, we introduce SafeDreamer, a novel algorithm incorporating Lagrangian-based"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2307.07176","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2307.07176/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2307.07176","created_at":"2026-07-05T08:53:16.528386+00:00"},{"alias_kind":"arxiv_version","alias_value":"2307.07176v3","created_at":"2026-07-05T08:53:16.528386+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2307.07176","created_at":"2026-07-05T08:53:16.528386+00:00"},{"alias_kind":"pith_short_12","alias_value":"4DAYUPQRZGZU","created_at":"2026-07-05T08:53:16.528386+00:00"},{"alias_kind":"pith_short_16","alias_value":"4DAYUPQRZGZU6DSD","created_at":"2026-07-05T08:53:16.528386+00:00"},{"alias_kind":"pith_short_8","alias_value":"4DAYUPQR","created_at":"2026-07-05T08:53:16.528386+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24010","citing_title":"Safe and Generalizable Hierarchical Multi-Agent RL via Constraint Manifold Control","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10228","citing_title":"SHAPO: Sharpness-Aware Policy Optimization for Safe Exploration","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2512.10226","citing_title":"Latent Chain-of-Thought World Modeling for End-to-End Driving","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.01346","citing_title":"Safety, Security, and Cognitive Risks in World Models","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16592","citing_title":"Human Cognition in Machines: A Unified Perspective of World Models","ref_index":69,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4DAYUPQRZGZU6DSDT6H3IQ3ED4","json":"https://pith.science/pith/4DAYUPQRZGZU6DSDT6H3IQ3ED4.json","graph_json":"https://pith.science/api/pith-number/4DAYUPQRZGZU6DSDT6H3IQ3ED4/graph.json","events_json":"https://pith.science/api/pith-number/4DAYUPQRZGZU6DSDT6H3IQ3ED4/events.json","paper":"https://pith.science/paper/4DAYUPQR"},"agent_actions":{"view_html":"https://pith.science/pith/4DAYUPQRZGZU6DSDT6H3IQ3ED4","download_json":"https://pith.science/pith/4DAYUPQRZGZU6DSDT6H3IQ3ED4.json","view_paper":"https://pith.science/paper/4DAYUPQR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2307.07176&json=true","fetch_graph":"https://pith.science/api/pith-number/4DAYUPQRZGZU6DSDT6H3IQ3ED4/graph.json","fetch_events":"https://pith.science/api/pith-number/4DAYUPQRZGZU6DSDT6H3IQ3ED4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4DAYUPQRZGZU6DSDT6H3IQ3ED4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4DAYUPQRZGZU6DSDT6H3IQ3ED4/action/storage_attestation","attest_author":"https://pith.science/pith/4DAYUPQRZGZU6DSDT6H3IQ3ED4/action/author_attestation","sign_citation":"https://pith.science/pith/4DAYUPQRZGZU6DSDT6H3IQ3ED4/action/citation_signature","submit_replication":"https://pith.science/pith/4DAYUPQRZGZU6DSDT6H3IQ3ED4/action/replication_record"}},"created_at":"2026-07-05T08:53:16.528386+00:00","updated_at":"2026-07-05T08:53:16.528386+00:00"}