{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:M4XVKVT76URFUNTCIE4HE63XZU","short_pith_number":"pith:M4XVKVT7","schema_version":"1.0","canonical_sha256":"672f55567ff5225a36624138727b77cd10d6fa166732f6aef8262e53670c7b83","source":{"kind":"arxiv","id":"2502.15806","version":2},"attestation_state":"computed","paper":{"title":"A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.CR","authors_text":"Liang Liu, Lujundong Li, Ruofan Wang, Xuan Tong, Yang Yao, Yan Teng, Yingchun Wang, Yixu Wang","submitted_at":"2025-02-19T07:23:36Z","abstract_excerpt":"Large Reasoning Models (LRMs) have significantly advanced beyond traditional Large Language Models (LLMs) with their exceptional logical reasoning capabilities, yet these improvements introduce heightened safety risks. When subjected to jailbreak attacks, their ability to generate more targeted and organized content can lead to greater harm. Although some studies claim that reasoning enables safer LRMs against existing LLM attacks, they overlook the inherent flaws within the reasoning process itself. To address this gap, we propose the first jailbreak attack targeting LRMs, exploiting their un"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.15806","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CR","submitted_at":"2025-02-19T07:23:36Z","cross_cats_sorted":["cs.AI","cs.CL","cs.LG"],"title_canon_sha256":"b899e0fe43e28bfe937753ae628e112a8b79e0290108631fc45e67b5359df4c1","abstract_canon_sha256":"14b8959ebdd90e0b0dae44b12747324451b4e4161617f278f6b0eec5807ef410"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:14:54.150300Z","signature_b64":"WzZyPMBq8Nm8nWZyJJ/O+39e07N0OM7wu4nKeVQYc3Raqppnv+Ffp13SASUacZv1hpxPKEhR+LE94fDcMlBsDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"672f55567ff5225a36624138727b77cd10d6fa166732f6aef8262e53670c7b83","last_reissued_at":"2026-07-05T11:14:54.149835Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:14:54.149835Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.CR","authors_text":"Liang Liu, Lujundong Li, Ruofan Wang, Xuan Tong, Yang Yao, Yan Teng, Yingchun Wang, Yixu Wang","submitted_at":"2025-02-19T07:23:36Z","abstract_excerpt":"Large Reasoning Models (LRMs) have significantly advanced beyond traditional Large Language Models (LLMs) with their exceptional logical reasoning capabilities, yet these improvements introduce heightened safety risks. When subjected to jailbreak attacks, their ability to generate more targeted and organized content can lead to greater harm. Although some studies claim that reasoning enables safer LRMs against existing LLM attacks, they overlook the inherent flaws within the reasoning process itself. To address this gap, we propose the first jailbreak attack targeting LRMs, exploiting their un"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.15806","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.15806/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.15806","created_at":"2026-07-05T11:14:54.149895+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.15806v2","created_at":"2026-07-05T11:14:54.149895+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.15806","created_at":"2026-07-05T11:14:54.149895+00:00"},{"alias_kind":"pith_short_12","alias_value":"M4XVKVT76URF","created_at":"2026-07-05T11:14:54.149895+00:00"},{"alias_kind":"pith_short_16","alias_value":"M4XVKVT76URFUNTC","created_at":"2026-07-05T11:14:54.149895+00:00"},{"alias_kind":"pith_short_8","alias_value":"M4XVKVT7","created_at":"2026-07-05T11:14:54.149895+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.19755","citing_title":"SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31748","citing_title":"Addressing Over-Refusal in LLMs with Competing Rewards","ref_index":82,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27981","citing_title":"ToxiREX: A Dataset on Toxic REasoning in ConteXt","ref_index":226,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19485","citing_title":"Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2508.04204","citing_title":"ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2510.08592","citing_title":"Less Diverse, Less Safe: The Indirect But Pervasive Risk of Test-Time Scaling in Large Language Models","ref_index":22,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/M4XVKVT76URFUNTCIE4HE63XZU","json":"https://pith.science/pith/M4XVKVT76URFUNTCIE4HE63XZU.json","graph_json":"https://pith.science/api/pith-number/M4XVKVT76URFUNTCIE4HE63XZU/graph.json","events_json":"https://pith.science/api/pith-number/M4XVKVT76URFUNTCIE4HE63XZU/events.json","paper":"https://pith.science/paper/M4XVKVT7"},"agent_actions":{"view_html":"https://pith.science/pith/M4XVKVT76URFUNTCIE4HE63XZU","download_json":"https://pith.science/pith/M4XVKVT76URFUNTCIE4HE63XZU.json","view_paper":"https://pith.science/paper/M4XVKVT7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.15806&json=true","fetch_graph":"https://pith.science/api/pith-number/M4XVKVT76URFUNTCIE4HE63XZU/graph.json","fetch_events":"https://pith.science/api/pith-number/M4XVKVT76URFUNTCIE4HE63XZU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/M4XVKVT76URFUNTCIE4HE63XZU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/M4XVKVT76URFUNTCIE4HE63XZU/action/storage_attestation","attest_author":"https://pith.science/pith/M4XVKVT76URFUNTCIE4HE63XZU/action/author_attestation","sign_citation":"https://pith.science/pith/M4XVKVT76URFUNTCIE4HE63XZU/action/citation_signature","submit_replication":"https://pith.science/pith/M4XVKVT76URFUNTCIE4HE63XZU/action/replication_record"}},"created_at":"2026-07-05T11:14:54.149895+00:00","updated_at":"2026-07-05T11:14:54.149895+00:00"}