{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ZAWQFZTLG37SLOERYKFIYUOTE5","short_pith_number":"pith:ZAWQFZTL","schema_version":"1.0","canonical_sha256":"c82d02e66b36ff25b891c28a8c51d3274893b02cdfdbb0958669b842b5e4e3cd","source":{"kind":"arxiv","id":"2508.07172","version":1},"attestation_state":"computed","paper":{"title":"Gradient Surgery for Safe LLM Fine-Tuning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Baolei Zhang, Biao Yi, Jiahao Li, Lihai Nie, Tiansheng Huang, Tong Li, Zheli Liu","submitted_at":"2025-08-10T04:13:41Z","abstract_excerpt":"Fine-tuning-as-a-Service introduces a critical vulnerability where a few malicious examples mixed into the user's fine-tuning dataset can compromise the safety alignment of Large Language Models (LLMs). While a recognized paradigm frames safe fine-tuning as a multi-objective optimization problem balancing user task performance with safety alignment, we find existing solutions are critically sensitive to the harmful ratio, with defenses degrading sharply as harmful ratio increases. We diagnose that this failure stems from conflicting gradients, where the user-task update directly undermines the"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2508.07172","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-08-10T04:13:41Z","cross_cats_sorted":[],"title_canon_sha256":"38763320507914b38311c43474779d790328c24b137bc60863cab7ca463a47d0","abstract_canon_sha256":"457ce90e5d7a30859c98387255c0a0ee463280e163eed8341178b0f4db5c3654"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:51:41.956441Z","signature_b64":"m9ecivyqFIOiI8YxTkPhC84NrE/DMAnpi9LiQZxBHDkLyjJoqU4krKNcNWssVOJIu21Ly006IIDL6Alr8IHWBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c82d02e66b36ff25b891c28a8c51d3274893b02cdfdbb0958669b842b5e4e3cd","last_reissued_at":"2026-07-05T11:51:41.955966Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:51:41.955966Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Gradient Surgery for Safe LLM Fine-Tuning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Baolei Zhang, Biao Yi, Jiahao Li, Lihai Nie, Tiansheng Huang, Tong Li, Zheli Liu","submitted_at":"2025-08-10T04:13:41Z","abstract_excerpt":"Fine-tuning-as-a-Service introduces a critical vulnerability where a few malicious examples mixed into the user's fine-tuning dataset can compromise the safety alignment of Large Language Models (LLMs). While a recognized paradigm frames safe fine-tuning as a multi-objective optimization problem balancing user task performance with safety alignment, we find existing solutions are critically sensitive to the harmful ratio, with defenses degrading sharply as harmful ratio increases. We diagnose that this failure stems from conflicting gradients, where the user-task update directly undermines the"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2508.07172","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2508.07172/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2508.07172","created_at":"2026-07-05T11:51:41.956023+00:00"},{"alias_kind":"arxiv_version","alias_value":"2508.07172v1","created_at":"2026-07-05T11:51:41.956023+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2508.07172","created_at":"2026-07-05T11:51:41.956023+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZAWQFZTLG37S","created_at":"2026-07-05T11:51:41.956023+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZAWQFZTLG37SLOER","created_at":"2026-07-05T11:51:41.956023+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZAWQFZTL","created_at":"2026-07-05T11:51:41.956023+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.09866","citing_title":"Two to Tango: Coupled Task-Reference Selection for Safe LLM Fine-tuning","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28030","citing_title":"SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04982","citing_title":"CURE:Circuit-Aware Unlearning for LLM-based Recommendation","ref_index":38,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZAWQFZTLG37SLOERYKFIYUOTE5","json":"https://pith.science/pith/ZAWQFZTLG37SLOERYKFIYUOTE5.json","graph_json":"https://pith.science/api/pith-number/ZAWQFZTLG37SLOERYKFIYUOTE5/graph.json","events_json":"https://pith.science/api/pith-number/ZAWQFZTLG37SLOERYKFIYUOTE5/events.json","paper":"https://pith.science/paper/ZAWQFZTL"},"agent_actions":{"view_html":"https://pith.science/pith/ZAWQFZTLG37SLOERYKFIYUOTE5","download_json":"https://pith.science/pith/ZAWQFZTLG37SLOERYKFIYUOTE5.json","view_paper":"https://pith.science/paper/ZAWQFZTL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2508.07172&json=true","fetch_graph":"https://pith.science/api/pith-number/ZAWQFZTLG37SLOERYKFIYUOTE5/graph.json","fetch_events":"https://pith.science/api/pith-number/ZAWQFZTLG37SLOERYKFIYUOTE5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZAWQFZTLG37SLOERYKFIYUOTE5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZAWQFZTLG37SLOERYKFIYUOTE5/action/storage_attestation","attest_author":"https://pith.science/pith/ZAWQFZTLG37SLOERYKFIYUOTE5/action/author_attestation","sign_citation":"https://pith.science/pith/ZAWQFZTLG37SLOERYKFIYUOTE5/action/citation_signature","submit_replication":"https://pith.science/pith/ZAWQFZTLG37SLOERYKFIYUOTE5/action/replication_record"}},"created_at":"2026-07-05T11:51:41.956023+00:00","updated_at":"2026-07-05T11:51:41.956023+00:00"}