Pith. sign in

Paper Citation Record · LEDGER

LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 54 inbound Pith citation observations for arXiv:2310.20624.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2310.20624 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 54 of 54 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 54 of 54 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T11:24:12.751139Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T12:59:53.050459Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 9316efe9-cb13-4923-b761-37516f01734b · inbound

Refusal in Language Models Is Mediated by a Single Direction cites this paper.

Refusal in Language Models Is Mediated by a Single Direction LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 146

Resolution
verified exact
arxiv_id, observed 2026-05-13T10:47:56.010904Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-13T10:47:55.934081Z digest=sha256:7972dd6d9d48aac6855c006130d8d7d32d0379894921e3363e3436e9a29d6e0e

Observation 6e7dbe39-3217-4a9a-8f83-2d7baaabdc48 · inbound

Jailbreak Attacks and Defenses Against Large Language Models: A Survey cites this paper.

Jailbreak Attacks and Defenses Against Large Language Models: A Survey LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-15T02:20:44.710807Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-15T02:20:44.368219Z digest=sha256:e3da66c6b7eb00dcc89fe9ea2f1799c7297b1fd4d6af58cacf1223891dfe6216

Observation 512ac141-c77c-4a46-bde9-1738150efb2a · inbound

Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey cites this paper.

Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 85

Resolution
verified exact
arxiv_id, observed 2026-05-23T20:58:26.335120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-23T20:58:16.237327Z digest=sha256:0c541360f508cd84866fc93934075408aa4c5f01e69e83e6d40210613db252a6

Observation d8447208-f019-47f7-82a9-87ec358b5985 · inbound

The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense cites this paper.

The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-12T21:45:34.729143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T21:45:34.729143Z digest=sha256:d9cd1dfe35e489df376769c97b936a91d3c8cda2904aaee4d044b4cd01721f98

Observation ccddd491-c751-49be-a071-633ce14a13ae · inbound

GPAI Evaluations Standards Taskforce: Towards Effective AI Governance cites this paper.

GPAI Evaluations Standards Taskforce: Towards Effective AI Governance LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-12T15:54:33.116950Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T15:54:33.116950Z digest=sha256:35b743824c35588fff3483af6e4eab14fc3a72fd49859ea5d1e57f38d06df6de

Observation 5fca5c7d-a565-451b-b61e-b2b49b1b1270 · inbound

Evaluating Large Language Models' Capability to Launch Fully Automated Spear Phishing Campaigns: Validated on Human Subjects cites this paper.

Evaluating Large Language Models' Capability to Launch Fully Automated Spear Phishing Campaigns: Validated on Human Subjects LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-12T05:20:17.196941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T05:20:17.196941Z digest=sha256:f7ff8ce18b46f84b481ba355215375d553df142f13b4c85c884d4cc7bdb61ed9

Observation 9ee0378f-8506-4ad4-92f1-2da3b8939805 · inbound

Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settings cites this paper.

Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settings LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-11T12:48:10.918511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T12:48:10.918511Z digest=sha256:7c69d668de185fbbbe7ad5ac4f1d0358c8d3d28796ff79da8fdad9767c7548cb

Observation b5580c03-ad9d-4d82-a648-b82d36d9a824 · inbound

Self-Instruct Few-Shot Jailbreaking: Decompose the Attack into Pattern and Behavior Learning cites this paper.

Self-Instruct Few-Shot Jailbreaking: Decompose the Attack into Pattern and Behavior Learning LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-10T20:35:52.788923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:35:52.788923Z digest=sha256:2331991757be3c5cf895d4ffe95d4c319ec4c2996b1dbdcc4044fa458372deae

Observation 619f6f9b-d965-483e-b743-811abd2d549f · inbound

A Survey on Responsible LLMs: Inherent Risk, Malicious Use, and Mitigation Strategy cites this paper.

A Survey on Responsible LLMs: Inherent Risk, Malicious Use, and Mitigation Strategy LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 107

Resolution
unresolved
no resolver link, observed 2026-08-10T20:05:12.322449Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:05:12.322449Z digest=sha256:be8e9ec5784dbf7594e6da0eee691b49870690d5257108b9bde8c7be1f445591

Observation 43acf8e1-359d-47e2-b21a-ca64edf4fd8d · inbound

Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities cites this paper.

Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T14:47:15.171392Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T14:47:15.171392Z digest=sha256:db99a220b62d6092ddc6c0a2302e0fac452d60306f3461cf58689c5c0eb992a3

Observation c79286d2-e8bf-4dca-bc5e-22518a51632a · inbound

Head-Specific Intervention Can Induce Misaligned AI Coordination in Large Language Models cites this paper.

Head-Specific Intervention Can Induce Misaligned AI Coordination in Large Language Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-08T17:23:02.390992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:23:02.390992Z digest=sha256:6451d924ad86741d53dc3be02ba179b1a22f1e21ed7ca408281ce427a645f90d

Observation 001670e7-7c84-4315-bf67-bd245bd8a832 · inbound

Jailbreaking to Jailbreak cites this paper.

Jailbreaking to Jailbreak LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-08T17:02:47.267212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:02:47.267212Z digest=sha256:c31a328be9aaa41147eb56144634bb25029c45f642db715ee7f0a9e096c5bac2

Observation 6c9623ff-4484-4887-8ecd-13bb6dc50b22 · inbound

A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment cites this paper.

A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 247

Resolution
unresolved
no resolver link, observed 2026-08-16T11:24:12.751139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:24:12.751139Z digest=sha256:8111dc19ac475c14bd6e3faef56a2b12141679724555e2cf037bcc7070b0ee39

Observation d50944d6-633b-422e-a924-cfd51cd52358 · inbound

Latent Adversarial Training Improves the Representation of Refusal cites this paper.

Latent Adversarial Training Improves the Representation of Refusal LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-16T10:11:37.839207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-16T10:11:37.839207Z digest=sha256:b79195e3191520561152384f43509ca5f03f3ec2b88491409e5d0ff8bb1af2b6

Observation a64fafb6-1742-41cd-abc8-cd146e66c4dd · inbound

NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models cites this paper.

NeuRel-Attack: Neuron Relearning for Safety Disalignment in Large Language Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T05:33:11.797685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-16T05:33:11.797685Z digest=sha256:639c8de3298ef1fe34b71890dee05aa1fb0daa0ce6abbca560a90efe80296111

Observation 6eb1d778-3ebd-4a15-a066-853035ae0e85 · inbound

Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation cites this paper.

Unlearning Sensitive Information in Multimodal LLMs: Benchmark and Attack-Defense Evaluation LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T04:52:53.032858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-16T04:52:53.032858Z digest=sha256:aecc33e78aa929062015c1c31ee34e03c82ac6bd0573fd0ddbf88ebc0bad7c75

Observation ad933c1b-7a01-4ba1-8ed3-cb314ddb6a47 · inbound

Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency cites this paper.

Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T23:33:38.516672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T23:33:38.516672Z digest=sha256:7892349aecba4a2c52d43d76811325ff092bfb3920a4aef118a5298a83f9d834

Observation 7baf0ade-4903-4696-9913-52d67c38e2f1 · inbound

Linearly Decoding Refused Knowledge in Aligned Language Models cites this paper.

Linearly Decoding Refused Knowledge in Aligned Language Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T21:27:34.939664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T21:27:34.939664Z digest=sha256:fcea8f66f6fdda6a44fdde88d8f3927a6b5d136e3c7ec8f304a5b69e3b279d8f

Observation 111021dd-05f6-465a-b48e-2376af7f3472 · inbound

The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models cites this paper.

The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T19:08:23.851271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T19:08:23.851271Z digest=sha256:e92f4bf5f926ceb36502306d7c537ab2fcbb79f8e828581f681438c9d53080b4

Observation 30f57e83-21f8-4faa-998b-68177e063140 · inbound

Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models cites this paper.

Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T16:25:55.084303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:25:55.084303Z digest=sha256:778c0a4e5a75a395e9599c6161c316c1d0ba2344d742628d1e8ff68e11cee226

Observation 2d34fdb0-117e-4693-9828-ae8a0c129d4b · inbound

SDD: Self-Degraded Defense against Malicious Fine-tuning cites this paper.

SDD: Self-Degraded Defense against Malicious Fine-tuning LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T17:55:13.849490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T17:55:13.849490Z digest=sha256:a995dfcddd4c903b562af2e25fb06f431e53c08a21f652c41e4b552f8d334112

Observation 42d9129f-7bb4-4215-ae7b-53ab8a841f8e · inbound

Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation cites this paper.

Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T20:31:36.299965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T20:31:36.299965Z digest=sha256:2d1ff0c807be164e38b5b4dc91f007090f806c965756c5c40cbeccfc37222aae

Observation faaf9a8b-ea31-4049-afa1-b341217cc66c · inbound

Consiglieres in the Shadow: Understanding the Use of Uncensored Large Language Models in Cybercrimes cites this paper.

Consiglieres in the Shadow: Understanding the Use of Uncensored Large Language Models in Cybercrimes LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 138

Resolution
unresolved
no resolver link, observed 2026-08-15T17:24:59.559435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T17:24:59.559435Z digest=sha256:dd6a8b2e5bf892d3cbee033c39cfb24cd6ff074acca27bc390c58dadf0c4037f

Observation b9f2add8-82a1-40b4-ae54-e40684a089a7 · inbound

Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning cites this paper.

Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-18T20:41:50.430368Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-18T20:40:44.496392Z digest=sha256:a2988523e3e052e3491b9a731618c9ba96755c320d21a590717dc898ac1341fa

Observation 755422c7-39cb-4e43-a9dd-d8e7670c5380 · inbound

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection cites this paper.

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T14:57:12.850194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:57:12.850194Z digest=sha256:6a5b4db8394f1c90030cdb0620ed69d79a68fdc0d72cf3db52c853a332cec9c1

Observation f0230405-d481-4232-a71e-a6bd91d0f21a · inbound

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models cites this paper.

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T10:32:27.753084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T10:32:27.753084Z digest=sha256:9a9beb33ffc7d359bf1208b037532f8b32e5a07cbbdc5b34956ce413ca39c923

Observation ce4ffc35-5ad8-47fc-81f3-d207b73311b6 · inbound

MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security cites this paper.

MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T23:09:41.450991Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:09:41.450991Z digest=sha256:7618068f30e53181482d58b9c2ee77dfde9f13ecccd53591784a2314b76aa54f

Observation 3407591e-bc9f-4f12-bf67-eb608e0b06f3 · inbound

Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm cites this paper.

Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-04T22:33:28.907738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T22:33:28.907738Z digest=sha256:7de81a99259db1d80a5b564f121a22c9de0010ecd101495f1d8ba2e22901bb77

Observation f39bbd99-254f-4599-8cfa-917f2b9d2688 · inbound

Understanding the Effects of Safety Unalignment on Large Language Models cites this paper.

Understanding the Effects of Safety Unalignment on Large Language Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-13T20:38:14.463635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-13T20:37:45.061026Z digest=sha256:a5d55a3520a8ad4201a221c4d3e72be6b6170b02914dbafc1172652549d2c572

Observation 51b9dee9-9552-4825-aa11-e8f2e9bbb3a6 · inbound

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs cites this paper.

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 17

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T08:02:24.899967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-10T08:01:25.938248Z digest=sha256:476c679e97b0a659e51c62d3becc06dc2127c9c3d77c15ef9424a753382b9664

Observation 422f1b45-3cb3-4390-9e7c-d6df5bc3ef48 · inbound

Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks cites this paper.

Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 39

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T11:56:31.698001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-10T04:24:25.964495Z digest=sha256:c9e6410b4164f396134efe4ede25eee3239b30d8a91d4a56b437406aa4b343bd

Observation da4a9885-859d-4dbf-8363-6f186afdc9e5 · inbound

Low-Rank Adaptation Redux for Large Models cites this paper.

Low-Rank Adaptation Redux for Large Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 100

Resolution
verified exact
arxiv_id, observed 2026-05-11T14:26:03.822655Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-09T21:48:48.992712Z digest=sha256:b16fb552bd04ef4ad8670fa5132faff89ac9db196b709d38a592b38d385370a8

Observation 8a03f853-c1c6-4675-89be-89d7d32986a4 · inbound

Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains cites this paper.

Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-11T23:11:19.248358Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-07T17:53:57.169962Z digest=sha256:ab4baff8149a150bed89eb38cd1092df34c76e5846b0fa1e9d7e47240f7fdd04

Observation 0fc8591f-5942-4348-ae96-eb953144eb4b · inbound

You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation cites this paper.

You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 79

Resolution
verified exact
arxiv_id, observed 2026-05-11T17:51:08.674491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-08T17:02:20.836208Z digest=sha256:ff0c223038fe6688bc057a443a236e1e14eb16f3f098f3ff9b6ad5a0d0c71e63

Observation 2d233b8b-046f-482e-86fd-c6c11a5a36ed · inbound

Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs cites this paper.

Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T07:07:27.074141Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-13T07:06:46.387088Z digest=sha256:2882fd522e291d64ac2b1cc269162d96102d73afc29ef18637f09e6a87cbc1ec

Observation d80882a7-057f-4b7e-8b5e-9fb5cb69ae57 · inbound

Persona-Model Collapse in Emergent Misalignment cites this paper.

Persona-Model Collapse in Emergent Misalignment LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-05-14T20:47:58.752995Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-14T20:44:09.214779Z digest=sha256:c467c8a151ea144b9ab616b7fc9bb1767c576dd2dbac926e7d26a530e48c6e4b

Observation 006257a1-00c8-49c0-bb49-ba8b76145c5f · inbound

Persona-Model Collapse in Emergent Misalignment cites this paper.

Persona-Model Collapse in Emergent Misalignment LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-07-01T14:15:47.617390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-30T22:05:29.444682Z digest=sha256:6bba7145ff490a0f25a07a5f7497b3962afd792712e778fb823c7797d0fee4d4

Observation f51e1717-a090-434d-a1fa-d80497739ad6 · inbound

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries cites this paper.

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-06-30T21:05:04.074611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-30T21:01:25.549340Z digest=sha256:fc5c823b12b413eba0a9aca7c96593eddacf229610d0dcd1eac0e0d34eb6eeec

Observation 7b52221c-a0a7-4743-9217-5e493c2088d3 · inbound

Adversarial Reframing: A Framework for Targeted Generation in Language Models cites this paper.

Adversarial Reframing: A Framework for Targeted Generation in Language Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 28

Resolution
metadata mismatch
arxiv_id, observed 2026-05-22T09:36:21.008543Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-22T09:35:51.862736Z digest=sha256:2946887a3b898cbbaaef09fe232a6f93670657a30dd116320636615b9d6e3bc4

Observation a77825fa-713f-43ea-b688-d21710ce826e · inbound

Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models cites this paper.

Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-06-30T13:04:40.288540Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-30T12:58:50.713928Z digest=sha256:7f8f43062686c72b08e20f6245548ecf9f5d52459aefdd52784ae9047bf8483c

Observation fb7efac4-ad6d-4700-806d-b596f98a71b9 · inbound

Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol cites this paper.

Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-06-30T14:14:45.888901Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-30T14:05:18.213065Z digest=sha256:2d56a13c32e2115807d3cf07686d08657718264c7d39d7ebc1d4788c653b0bcb

Observation 76c0ffc5-9fb8-420a-bd4e-450a48bf5004 · inbound

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions cites this paper.

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 82

Resolution
verified exact
arxiv_id, observed 2026-06-29T23:54:03.326066Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-29T23:51:05.413122Z digest=sha256:b5cbf77b8e12ec54273732b6e43449d2a450ea6be00d2459a9d5220196becc4a

Observation e8bf7610-d2e3-4ecc-a0ea-df10c8c82bca · inbound

Curriculum Learning for Safety Alignment cites this paper.

Curriculum Learning for Safety Alignment LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-06-29T22:34:02.186396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-29T22:25:31.739331Z digest=sha256:95de8611278e15411e3e8736629c065df64e57a949e61686603f171744be839d

Observation 671d674a-6cd5-42cc-b508-bc3daa08761e · inbound

Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks cites this paper.

Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:53.626743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-29T19:23:47.574214Z digest=sha256:97f0aee099c8bc53d4d919ac0398f2ec8b507841a354875da43bc88427f8989a

Observation 4fe3cc67-1891-4f66-ace7-8f8b60f7b0ee · inbound

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection cites this paper.

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-06-29T13:53:28.681269Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-29T13:49:56.311711Z digest=sha256:993b1395ebec3bd05561c6f11139d25c6573cca13f4b94f03f229a74fac8fbc7

Observation 29586d0c-7565-48ab-9965-d676f03aa345 · inbound

DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning cites this paper.

DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-07-01T19:46:10.225624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-28T22:09:02.498712Z digest=sha256:f4c46affa2f02ab0e99cab3868e2f4ada63c41afe5b623a2d3739eee87c8f0bd

Observation 93a5ac7b-9a1f-40a6-af55-c8c43f8b5b4a · inbound

Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning cites this paper.

Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-01T20:56:13.872764Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-28T17:37:51.505359Z digest=sha256:1f352d887c6c607ee23bebcf78f81951bd768fa04220a8fdcba8575ae5352a0a

Observation d1f12f49-34ff-415b-8778-47ce65e5716a · inbound

RepSelect: Robust LLM Unlearning via Representation Selectivity cites this paper.

RepSelect: Robust LLM Unlearning via Representation Selectivity LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-07-03T17:58:47.234243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-27T03:34:32.388152Z digest=sha256:2e41b5f06ef1909172359c243efe0221412486ca67376725a3f5979618529dae

Observation 0d16d39a-46d0-490c-bbfe-bfd4c1cd6bda · inbound

Discovering Millions of Interpretable Features with Sparse Autoencoders cites this paper.

Discovering Millions of Interpretable Features with Sparse Autoencoders LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-07-04T12:59:53.052072Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-26T05:34:00.754172Z digest=sha256:30d22cfd2091418f72f4bb571b85ed0c65a43da59c872a2d76a968c1d30e6317

Observation 7763be8f-401c-46ff-834f-475b65181e5f · inbound

The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning cites this paper.

The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-06-30T09:54:34.733665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-30T09:52:42.862423Z digest=sha256:365ccef6861e58eff5dcb163255210e7e07bf2fd80b4004f16093e1d81c7056d

Observation 150f3f6e-8b64-4988-9ed7-8e975ea53f56 · inbound

Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale cites this paper.

Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-12T07:33:43.015966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T07:33:43.015966Z digest=sha256:4bc7e588bd12c22461b2ce98d0f0d4801e7189dc7998a4d8597ea02c3e01d7b8

Observation a946a932-8846-47e0-af95-2f39d7873f13 · inbound

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment cites this paper.

TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-02T10:00:11.935152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T10:00:11.935152Z digest=sha256:09ef96b79d046a164ea1149bb5503826b08d2eaf4a720b9f9a30ffc04c80d700

Observation ed4e70e1-67fb-424a-937f-79b556eadb57 · inbound

How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift cites this paper.

How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-02T07:44:09.563432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:44:09.563432Z digest=sha256:64f19d039aa3f2873c436e5ad19bea25f72d845eef3f525c5b9617c7c39e3bb7

Observation ed595a6f-298f-4b54-97b1-b072efecf5e5 · inbound

When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs cites this paper.

When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-14T04:46:15.956173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:46:15.956173Z digest=sha256:0ba63bfa2d723f10b861d91741f3eff7c99475b16bbb3401ba118c96f40adcc6