{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:4TJXJLGY6TCJRR24IR2ISMWGSP","short_pith_number":"pith:4TJXJLGY","schema_version":"1.0","canonical_sha256":"e4d374acd8f4c498c75c44748932c693d1b8c108e448ea796eca2dfd713e974f","source":{"kind":"arxiv","id":"2504.17704","version":3},"attestation_state":"computed","paper":{"title":"Safety in Large Reasoning Models: A Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Baolong Bi, Bryan Hooi, Cheng Wang, Duzhen Zhang, Jiaheng Zhang, Junfeng Fang, Shengju Yu, Xinfeng Li, Yingwei Ma, Yue Liu, Yufei He, Zhong-Zhi Li","submitted_at":"2025-04-24T16:11:01Z","abstract_excerpt":"Large Reasoning Models (LRMs) have exhibited extraordinary prowess in tasks like mathematics and coding, leveraging their advanced reasoning capabilities. Nevertheless, as these capabilities progress, significant concerns regarding their vulnerabilities and safety have arisen, which can pose challenges to their deployment and application in real-world settings. This paper presents a comprehensive survey of LRMs, meticulously exploring and summarizing the newly emerged safety risks, attacks, and defense strategies. By organizing these elements into a detailed taxonomy, this work aims to offer a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.17704","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-04-24T16:11:01Z","cross_cats_sorted":[],"title_canon_sha256":"7220b990ee6385b571afaf96dd11f3a57ec55ab9218d4525fbc44c9af48d9c1a","abstract_canon_sha256":"49ede3814b41a4a11abe7d1fee0457f2fba084b4e4e2e537989d370a7d9b814d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:09:12.021099Z","signature_b64":"5jDnzs5UTJDdJ25Rgaw4Fg3hfYf9u9uPucQ8TBUGJxcSoVDYkD/2C+vhQcGwsrdELpCEzvvg34IPnWwCd3oJDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e4d374acd8f4c498c75c44748932c693d1b8c108e448ea796eca2dfd713e974f","last_reissued_at":"2026-07-05T11:09:12.020611Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:09:12.020611Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Safety in Large Reasoning Models: A Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Baolong Bi, Bryan Hooi, Cheng Wang, Duzhen Zhang, Jiaheng Zhang, Junfeng Fang, Shengju Yu, Xinfeng Li, Yingwei Ma, Yue Liu, Yufei He, Zhong-Zhi Li","submitted_at":"2025-04-24T16:11:01Z","abstract_excerpt":"Large Reasoning Models (LRMs) have exhibited extraordinary prowess in tasks like mathematics and coding, leveraging their advanced reasoning capabilities. Nevertheless, as these capabilities progress, significant concerns regarding their vulnerabilities and safety have arisen, which can pose challenges to their deployment and application in real-world settings. This paper presents a comprehensive survey of LRMs, meticulously exploring and summarizing the newly emerged safety risks, attacks, and defense strategies. By organizing these elements into a detailed taxonomy, this work aims to offer a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.17704","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.17704/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.17704","created_at":"2026-07-05T11:09:12.020670+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.17704v3","created_at":"2026-07-05T11:09:12.020670+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.17704","created_at":"2026-07-05T11:09:12.020670+00:00"},{"alias_kind":"pith_short_12","alias_value":"4TJXJLGY6TCJ","created_at":"2026-07-05T11:09:12.020670+00:00"},{"alias_kind":"pith_short_16","alias_value":"4TJXJLGY6TCJRR24","created_at":"2026-07-05T11:09:12.020670+00:00"},{"alias_kind":"pith_short_8","alias_value":"4TJXJLGY","created_at":"2026-07-05T11:09:12.020670+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2504.20472","citing_title":"Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2508.04204","citing_title":"ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2510.21285","citing_title":"When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2603.25412","citing_title":"Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12813","citing_title":"REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09584","citing_title":"CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24082","citing_title":"Jailbreaking Frontier Foundation Models Through Intention Deception","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12548","citing_title":"DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15725","citing_title":"Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing","ref_index":31,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4TJXJLGY6TCJRR24IR2ISMWGSP","json":"https://pith.science/pith/4TJXJLGY6TCJRR24IR2ISMWGSP.json","graph_json":"https://pith.science/api/pith-number/4TJXJLGY6TCJRR24IR2ISMWGSP/graph.json","events_json":"https://pith.science/api/pith-number/4TJXJLGY6TCJRR24IR2ISMWGSP/events.json","paper":"https://pith.science/paper/4TJXJLGY"},"agent_actions":{"view_html":"https://pith.science/pith/4TJXJLGY6TCJRR24IR2ISMWGSP","download_json":"https://pith.science/pith/4TJXJLGY6TCJRR24IR2ISMWGSP.json","view_paper":"https://pith.science/paper/4TJXJLGY","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.17704&json=true","fetch_graph":"https://pith.science/api/pith-number/4TJXJLGY6TCJRR24IR2ISMWGSP/graph.json","fetch_events":"https://pith.science/api/pith-number/4TJXJLGY6TCJRR24IR2ISMWGSP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4TJXJLGY6TCJRR24IR2ISMWGSP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4TJXJLGY6TCJRR24IR2ISMWGSP/action/storage_attestation","attest_author":"https://pith.science/pith/4TJXJLGY6TCJRR24IR2ISMWGSP/action/author_attestation","sign_citation":"https://pith.science/pith/4TJXJLGY6TCJRR24IR2ISMWGSP/action/citation_signature","submit_replication":"https://pith.science/pith/4TJXJLGY6TCJRR24IR2ISMWGSP/action/replication_record"}},"created_at":"2026-07-05T11:09:12.020670+00:00","updated_at":"2026-07-05T11:09:12.020670+00:00"}