{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:ROUZGGSVLV2WIXG3YLKMHRWDMI","short_pith_number":"pith:ROUZGGSV","schema_version":"1.0","canonical_sha256":"8ba9931a555d75645cdbc2d4c3c6c3621ce8b3d1458c052c6d8310470ccca233","source":{"kind":"arxiv","id":"2406.11285","version":2},"attestation_state":"computed","paper":{"title":"Self and Cross-Model Distillation for LLMs: Effective Methods for Refusal Pattern Alignment","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CR","authors_text":"ChongYang Liu, Jie Li, Ling Shi, Weisong Sun, Xiaoning Ren, Yi Liu, Yinxing Xue","submitted_at":"2024-06-17T07:46:45Z","abstract_excerpt":"Large Language Models (LLMs) like OpenAI's GPT series, Anthropic's Claude, and Meta's LLaMa have shown remarkable capabilities in text generation. However, their susceptibility to toxic prompts presents significant security challenges. This paper investigates alignment techniques, including Supervised Fine-Tuning (SFT) and Reinforcement Learning from Human Feedback (RLHF), to mitigate these risks. We conduct an empirical study on refusal patterns across nine LLMs, revealing that models with uniform refusal patterns, such as Claude3, exhibit higher security. Based on these findings, we propose "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.11285","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CR","submitted_at":"2024-06-17T07:46:45Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"fecf66a4307e3b9a96d35b45eca46caffb614b5f9aa9bedc17a02909dede1dab","abstract_canon_sha256":"89f4e04e7e6af5f687d55bcfd8372e54a0d9851df9b095019c0b567e2103fc28"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:42:26.584248Z","signature_b64":"PiA87oYGkD9fiqFH3eRNGoD1psdqyb9evGT43pGTuDD9zHQaJMg/0RCPMdknhPDkGomM9icwwQGpiDkTAQWFDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8ba9931a555d75645cdbc2d4c3c6c3621ce8b3d1458c052c6d8310470ccca233","last_reissued_at":"2026-07-05T09:42:26.583760Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:42:26.583760Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Self and Cross-Model Distillation for LLMs: Effective Methods for Refusal Pattern Alignment","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CR","authors_text":"ChongYang Liu, Jie Li, Ling Shi, Weisong Sun, Xiaoning Ren, Yi Liu, Yinxing Xue","submitted_at":"2024-06-17T07:46:45Z","abstract_excerpt":"Large Language Models (LLMs) like OpenAI's GPT series, Anthropic's Claude, and Meta's LLaMa have shown remarkable capabilities in text generation. However, their susceptibility to toxic prompts presents significant security challenges. This paper investigates alignment techniques, including Supervised Fine-Tuning (SFT) and Reinforcement Learning from Human Feedback (RLHF), to mitigate these risks. We conduct an empirical study on refusal patterns across nine LLMs, revealing that models with uniform refusal patterns, such as Claude3, exhibit higher security. Based on these findings, we propose "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.11285","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.11285/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.11285","created_at":"2026-07-05T09:42:26.583826+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.11285v2","created_at":"2026-07-05T09:42:26.583826+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.11285","created_at":"2026-07-05T09:42:26.583826+00:00"},{"alias_kind":"pith_short_12","alias_value":"ROUZGGSVLV2W","created_at":"2026-07-05T09:42:26.583826+00:00"},{"alias_kind":"pith_short_16","alias_value":"ROUZGGSVLV2WIXG3","created_at":"2026-07-05T09:42:26.583826+00:00"},{"alias_kind":"pith_short_8","alias_value":"ROUZGGSV","created_at":"2026-07-05T09:42:26.583826+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.00105","citing_title":"Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning","ref_index":27,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ROUZGGSVLV2WIXG3YLKMHRWDMI","json":"https://pith.science/pith/ROUZGGSVLV2WIXG3YLKMHRWDMI.json","graph_json":"https://pith.science/api/pith-number/ROUZGGSVLV2WIXG3YLKMHRWDMI/graph.json","events_json":"https://pith.science/api/pith-number/ROUZGGSVLV2WIXG3YLKMHRWDMI/events.json","paper":"https://pith.science/paper/ROUZGGSV"},"agent_actions":{"view_html":"https://pith.science/pith/ROUZGGSVLV2WIXG3YLKMHRWDMI","download_json":"https://pith.science/pith/ROUZGGSVLV2WIXG3YLKMHRWDMI.json","view_paper":"https://pith.science/paper/ROUZGGSV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.11285&json=true","fetch_graph":"https://pith.science/api/pith-number/ROUZGGSVLV2WIXG3YLKMHRWDMI/graph.json","fetch_events":"https://pith.science/api/pith-number/ROUZGGSVLV2WIXG3YLKMHRWDMI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ROUZGGSVLV2WIXG3YLKMHRWDMI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ROUZGGSVLV2WIXG3YLKMHRWDMI/action/storage_attestation","attest_author":"https://pith.science/pith/ROUZGGSVLV2WIXG3YLKMHRWDMI/action/author_attestation","sign_citation":"https://pith.science/pith/ROUZGGSVLV2WIXG3YLKMHRWDMI/action/citation_signature","submit_replication":"https://pith.science/pith/ROUZGGSVLV2WIXG3YLKMHRWDMI/action/replication_record"}},"created_at":"2026-07-05T09:42:26.583826+00:00","updated_at":"2026-07-05T09:42:26.583826+00:00"}