{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:SYM4AE7D4VWENC472SUY7O5PSC","short_pith_number":"pith:SYM4AE7D","schema_version":"1.0","canonical_sha256":"9619c013e3e56c468b9fd4a98fbbaf90bf70bcef7b8cf2d2f3842c5c06fcfe66","source":{"kind":"arxiv","id":"2509.06795","version":1},"attestation_state":"computed","paper":{"title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Bing Qin, Fenglei Fan, Jiawei Cao, Kai He, Mengling Feng, Qika Lin, Sendong Zhao, Ting Liu, Yanrui Du","submitted_at":"2025-09-08T15:24:33Z","abstract_excerpt":"Instruction Fine-Tuning (IFT) has been widely adopted as an effective post-training strategy to enhance various abilities of Large Language Models (LLMs). However, prior studies have shown that IFT can significantly compromise LLMs' safety, particularly their ability to refuse malicious instructions, raising significant concerns. Recent research into the internal mechanisms of LLMs has identified the refusal direction (r-direction) in the hidden states, which plays a pivotal role in governing refusal behavior. Building on this insight, our study reveals that the r-direction tends to drift duri"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.06795","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-09-08T15:24:33Z","cross_cats_sorted":[],"title_canon_sha256":"445f3058480d943f9a9c4e6d99c7c64123d549094e710997fe554008f6661c11","abstract_canon_sha256":"c3b5aedb06568a15623ba1b4714c1676741e9c7b9e8c453405051754532d26a1"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:06:53.198671Z","signature_b64":"pMjzqVdI8aLB8lsSefFkXhHoMlnJTZbIXXivfyOaOjQus1lN0k9jvEibKAjEXhlat0wsXA2nktci93WuI1hVBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"9619c013e3e56c468b9fd4a98fbbaf90bf70bcef7b8cf2d2f3842c5c06fcfe66","last_reissued_at":"2026-07-05T12:06:53.198051Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:06:53.198051Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Bing Qin, Fenglei Fan, Jiawei Cao, Kai He, Mengling Feng, Qika Lin, Sendong Zhao, Ting Liu, Yanrui Du","submitted_at":"2025-09-08T15:24:33Z","abstract_excerpt":"Instruction Fine-Tuning (IFT) has been widely adopted as an effective post-training strategy to enhance various abilities of Large Language Models (LLMs). However, prior studies have shown that IFT can significantly compromise LLMs' safety, particularly their ability to refuse malicious instructions, raising significant concerns. Recent research into the internal mechanisms of LLMs has identified the refusal direction (r-direction) in the hidden states, which plays a pivotal role in governing refusal behavior. Building on this insight, our study reveals that the r-direction tends to drift duri"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.06795","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.06795/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.06795","created_at":"2026-07-05T12:06:53.198131+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.06795v1","created_at":"2026-07-05T12:06:53.198131+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.06795","created_at":"2026-07-05T12:06:53.198131+00:00"},{"alias_kind":"pith_short_12","alias_value":"SYM4AE7D4VWE","created_at":"2026-07-05T12:06:53.198131+00:00"},{"alias_kind":"pith_short_16","alias_value":"SYM4AE7D4VWENC47","created_at":"2026-07-05T12:06:53.198131+00:00"},{"alias_kind":"pith_short_8","alias_value":"SYM4AE7D","created_at":"2026-07-05T12:06:53.198131+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.15980","citing_title":"Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness","ref_index":52,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SYM4AE7D4VWENC472SUY7O5PSC","json":"https://pith.science/pith/SYM4AE7D4VWENC472SUY7O5PSC.json","graph_json":"https://pith.science/api/pith-number/SYM4AE7D4VWENC472SUY7O5PSC/graph.json","events_json":"https://pith.science/api/pith-number/SYM4AE7D4VWENC472SUY7O5PSC/events.json","paper":"https://pith.science/paper/SYM4AE7D"},"agent_actions":{"view_html":"https://pith.science/pith/SYM4AE7D4VWENC472SUY7O5PSC","download_json":"https://pith.science/pith/SYM4AE7D4VWENC472SUY7O5PSC.json","view_paper":"https://pith.science/paper/SYM4AE7D","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.06795&json=true","fetch_graph":"https://pith.science/api/pith-number/SYM4AE7D4VWENC472SUY7O5PSC/graph.json","fetch_events":"https://pith.science/api/pith-number/SYM4AE7D4VWENC472SUY7O5PSC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SYM4AE7D4VWENC472SUY7O5PSC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SYM4AE7D4VWENC472SUY7O5PSC/action/storage_attestation","attest_author":"https://pith.science/pith/SYM4AE7D4VWENC472SUY7O5PSC/action/author_attestation","sign_citation":"https://pith.science/pith/SYM4AE7D4VWENC472SUY7O5PSC/action/citation_signature","submit_replication":"https://pith.science/pith/SYM4AE7D4VWENC472SUY7O5PSC/action/replication_record"}},"created_at":"2026-07-05T12:06:53.198131+00:00","updated_at":"2026-07-05T12:06:53.198131+00:00"}