{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:B42RSK2IDRG4A7DYUUIFVTECNB","short_pith_number":"pith:B42RSK2I","schema_version":"1.0","canonical_sha256":"0f35192b481c4dc07c78a5105acc8268768db5c97e00ff27946f3a060be3c373","source":{"kind":"arxiv","id":"2508.12531","version":1},"attestation_state":"computed","paper":{"title":"Rethinking Safety in LLM Fine-tuning: An Optimization Perspective","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Adel Bibi, Bernard Ghanem, David Krueger, Fazl Barez, Jin Myung Kwak, Lama Alssum, Minseon Kim, Philip Torr","submitted_at":"2025-08-17T23:46:36Z","abstract_excerpt":"Fine-tuning language models is commonly believed to inevitably harm their safety, i.e., refusing to respond to harmful user requests, even when using harmless datasets, thus requiring additional safety measures. We challenge this belief through systematic testing, showing that poor optimization choices, rather than inherent trade-offs, often cause safety problems, measured as harmful responses to adversarial prompts. By properly selecting key training hyper-parameters, e.g., learning rate, batch size, and gradient steps, we reduce unsafe model responses from 16\\% to approximately 5\\%, as measu"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2508.12531","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.LG","submitted_at":"2025-08-17T23:46:36Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"825bd93aae0cb7324929bc3387a0eeecb5fb17f864912ce4a9d49775ae8f3cfc","abstract_canon_sha256":"26fd6e6d06204157e7a3c21b603cd291971ee18a77ad5a75cf51feaf250c61e5"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:55:07.697357Z","signature_b64":"adDHpF5GvhG1yuCu5KsC0VpNGfeAWabWlQLM5vec5EFZbfFo/lUKr4GKXs6uE/gWcCM1NCbkLpJI9p6jBwn7Cg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0f35192b481c4dc07c78a5105acc8268768db5c97e00ff27946f3a060be3c373","last_reissued_at":"2026-07-05T11:55:07.696894Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:55:07.696894Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Rethinking Safety in LLM Fine-tuning: An Optimization Perspective","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Adel Bibi, Bernard Ghanem, David Krueger, Fazl Barez, Jin Myung Kwak, Lama Alssum, Minseon Kim, Philip Torr","submitted_at":"2025-08-17T23:46:36Z","abstract_excerpt":"Fine-tuning language models is commonly believed to inevitably harm their safety, i.e., refusing to respond to harmful user requests, even when using harmless datasets, thus requiring additional safety measures. We challenge this belief through systematic testing, showing that poor optimization choices, rather than inherent trade-offs, often cause safety problems, measured as harmful responses to adversarial prompts. By properly selecting key training hyper-parameters, e.g., learning rate, batch size, and gradient steps, we reduce unsafe model responses from 16\\% to approximately 5\\%, as measu"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2508.12531","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2508.12531/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2508.12531","created_at":"2026-07-05T11:55:07.696951+00:00"},{"alias_kind":"arxiv_version","alias_value":"2508.12531v1","created_at":"2026-07-05T11:55:07.696951+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2508.12531","created_at":"2026-07-05T11:55:07.696951+00:00"},{"alias_kind":"pith_short_12","alias_value":"B42RSK2IDRG4","created_at":"2026-07-05T11:55:07.696951+00:00"},{"alias_kind":"pith_short_16","alias_value":"B42RSK2IDRG4A7DY","created_at":"2026-07-05T11:55:07.696951+00:00"},{"alias_kind":"pith_short_8","alias_value":"B42RSK2I","created_at":"2026-07-05T11:55:07.696951+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.28332","citing_title":"When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16659","citing_title":"Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/B42RSK2IDRG4A7DYUUIFVTECNB","json":"https://pith.science/pith/B42RSK2IDRG4A7DYUUIFVTECNB.json","graph_json":"https://pith.science/api/pith-number/B42RSK2IDRG4A7DYUUIFVTECNB/graph.json","events_json":"https://pith.science/api/pith-number/B42RSK2IDRG4A7DYUUIFVTECNB/events.json","paper":"https://pith.science/paper/B42RSK2I"},"agent_actions":{"view_html":"https://pith.science/pith/B42RSK2IDRG4A7DYUUIFVTECNB","download_json":"https://pith.science/pith/B42RSK2IDRG4A7DYUUIFVTECNB.json","view_paper":"https://pith.science/paper/B42RSK2I","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2508.12531&json=true","fetch_graph":"https://pith.science/api/pith-number/B42RSK2IDRG4A7DYUUIFVTECNB/graph.json","fetch_events":"https://pith.science/api/pith-number/B42RSK2IDRG4A7DYUUIFVTECNB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/B42RSK2IDRG4A7DYUUIFVTECNB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/B42RSK2IDRG4A7DYUUIFVTECNB/action/storage_attestation","attest_author":"https://pith.science/pith/B42RSK2IDRG4A7DYUUIFVTECNB/action/author_attestation","sign_citation":"https://pith.science/pith/B42RSK2IDRG4A7DYUUIFVTECNB/action/citation_signature","submit_replication":"https://pith.science/pith/B42RSK2IDRG4A7DYUUIFVTECNB/action/replication_record"}},"created_at":"2026-07-05T11:55:07.696951+00:00","updated_at":"2026-07-05T11:55:07.696951+00:00"}