{"as_of":"2026-08-09T20:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37d28e36025d4cf249a2c4b02c61be874385fa2b2c5df69852a66f8191e8bd5b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:47:15.171392Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:59:53.050459Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-13T10:47:55.934081Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2406.11717"},"observation_digest":"sha256:e3fe3068e4cba878058dd1477dc00aeea988d4f231955bbbd7359dd5a935d53b","observation_id":"9316efe9-cb13-4923-b761-37516f01734b","resolution":{"observed_at":"2026-05-13T10:47:56.010904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:405024aea3c0700c6199639dfe67e92c1df2288c6806eb932cf7314eaa48609a","observation_id":"6e7dbe39-3217-4a9a-8f83-2d7baaabdc48","resolution":{"observed_at":"2026-05-15T02:20:44.710807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-23T20:58:16.237327Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2409.18169"},"observation_digest":"sha256:ea1596c2c95be9f3dac7418a81f42034b79661665906768eef7b9a61c9532a89","observation_id":"512ac141-c77c-4a46-bde9-1738150efb2a","resolution":{"observed_at":"2026-05-23T20:58:26.335120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-09T14:47:15.171392Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05209","last_updated":"2025-07-24T21:34:54Z","snapshot_observed_at":"2026-08-09T14:40:37.335660Z","submitted_at":"2025-02-03T18:59:16Z","title":"Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:15.171392Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2502.05209"},"observation_digest":"sha256:c062e260547c9222a16a45001bc1e23b81a2b607926d44722b91cbc26ba144e0","observation_id":"43acf8e1-359d-47e2-b21a-ca64edf4fd8d","resolution":{"observed_at":"2026-08-09T14:47:15.171392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-08T17:23:02.390992Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b.arXiv preprint arXiv:2310.20624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05945","last_updated":"2025-08-25T08:20:08Z","snapshot_observed_at":"2026-08-08T17:14:49.549922Z","submitted_at":"2025-02-09T16:11:57Z","title":"Head-Specific Intervention Can Induce Misaligned AI Coordination in Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T17:23:02.390992Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2502.05945"},"observation_digest":"sha256:bb3ed99fd97e0b6aa5e699a0b2ab70d6b3cb0f06f504dc02ee28f3b246945013","observation_id":"c79286d2-e8bf-4dca-bc5e-22518a51632a","resolution":{"observed_at":"2026-08-08T17:23:02.390992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-08T17:02:47.267212Z","title":"Lermen, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09638","last_updated":"2025-05-29T06:12:00Z","snapshot_observed_at":"2026-08-09T01:40:08.338849Z","submitted_at":"2025-02-09T20:49:16Z","title":"Jailbreaking to Jailbreak","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T17:02:47.267212Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2502.09638"},"observation_digest":"sha256:622f1bc856e040590ed83a0ec65c409e07a6b7a2b6240a0a285e7274026b0724","observation_id":"001670e7-7c84-4315-bf67-bd245bd8a832","resolution":{"observed_at":"2026-08-08T17:02:47.267212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-06T23:33:38.516672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17209","last_updated":"2025-06-20T17:57:12Z","snapshot_observed_at":"2026-08-08T06:00:05.474887Z","submitted_at":"2025-06-20T17:57:12Z","title":"Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:33:38.516672Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2506.17209"},"observation_digest":"sha256:1bbb57e4997371bf546eb0f6616db2d82bf886f201b39cb3c19237b91379c364","observation_id":"ad933c1b-7a01-4ba1-8ed3-cb314ddb6a47","resolution":{"observed_at":"2026-08-06T23:33:38.516672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-06T21:27:34.939664Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.939664Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:49060ad40f8cedf9a659a3f3d9f59374ed2ee52afe9c367eb77a5540ecf77b97","observation_id":"7baf0ade-4903-4696-9913-52d67c38e2f1","resolution":{"observed_at":"2026-08-06T21:27:34.939664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-06T19:08:23.851271Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11544","last_updated":"2025-07-08T23:58:01Z","snapshot_observed_at":"2026-08-06T22:09:08.446996Z","submitted_at":"2025-07-08T23:58:01Z","title":"The Safety Gap Toolkit: Evaluating Hidden Dangers of Open-Source Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:08:23.851271Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2507.11544"},"observation_digest":"sha256:bf5e7978313a4e9e47a9eeb4e554cadd3d2d53ddc868562ab33610d458c8a026","observation_id":"111021dd-05f6-465a-b48e-2376af7f3472","resolution":{"observed_at":"2026-08-06T19:08:23.851271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-06T16:25:55.084303Z","title":"Lora fine-tuning effi- ciently undoes safety training in llama 2-chat 70b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13761","last_updated":"2025-07-18T09:13:05Z","snapshot_observed_at":"2026-08-09T17:23:00.228187Z","submitted_at":"2025-07-18T09:13:05Z","title":"Innocence in the Crossfire: Roles of Skip Connections in Jailbreaking Visual Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:25:55.084303Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2507.13761"},"observation_digest":"sha256:4a3daf59555088ba163e2507cfd11ff73ca21fd32f689a3d858f4ca90cb34b89","observation_id":"30f57e83-21f8-4faa-998b-68177e063140","resolution":{"observed_at":"2026-08-06T16:25:55.084303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-05T20:31:36.299965Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10404","last_updated":"2025-08-14T07:12:44Z","snapshot_observed_at":"2026-08-08T02:31:17.622343Z","submitted_at":"2025-08-14T07:12:44Z","title":"Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:36.299965Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2508.10404"},"observation_digest":"sha256:8a4267dd7c4164366b0f55c42f613c4541d4eae34dff68667663101e6be4c801","observation_id":"42d9129f-7bb4-4215-ae7b-53ab8a841f8e","resolution":{"observed_at":"2026-08-05T20:31:36.299965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-08-04T09:31:07Z","snapshot_observed_at":"2026-08-07T23:09:05.524726Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:7b203ad34caf3be154c4ab4c0b9fb41762e0c2f4ba4a879a578ab8d4ea2d6e2a","observation_id":"b9f2add8-82a1-40b4-ae54-e40684a089a7","resolution":{"observed_at":"2026-05-18T20:41:50.430368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-05T14:57:12.850194Z","title":"LoRA fine-tuning efficiently undoes safety training in Llama 2-Chat 70B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.850194Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:64ca351d481b4459837cb4d05be9ab46c7fbfec90dc35177b24faba1699c12c4","observation_id":"755422c7-39cb-4e43-a9dd-d8e7670c5380","resolution":{"observed_at":"2026-08-05T14:57:12.850194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-05T10:32:27.753084Z","title":"Lermen, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03985","last_updated":"2025-09-04T08:12:06Z","snapshot_observed_at":"2026-08-09T13:09:33.079254Z","submitted_at":"2025-09-04T08:12:06Z","title":"NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:32:27.753084Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2509.03985"},"observation_digest":"sha256:2c4cfd010b4d872036ffcf88d0443aa55f69eb29e40585aac1f3210333ce580f","observation_id":"f0230405-d481-4232-a71e-a6bd91d0f21a","resolution":{"observed_at":"2026-08-05T10:32:27.753084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-04T23:09:41.450991Z","title":"Lora fine-tuning effi- ciently undoes safety training in llama 2-chat 70b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-09T10:59:34.311406Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.450991Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:e410f80fc0f5f874de477f5141880b324e6dac139409c8f7d9a02d3ee71f5570","observation_id":"ce4ffc35-5ad8-47fc-81f3-d207b73311b6","resolution":{"observed_at":"2026-08-04T23:09:41.450991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-04T22:33:28.907738Z","title":"Lora fine-tuning effi- ciently undoes safety training in llama 2-chat 70b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07287","last_updated":"2025-09-08T23:44:00Z","snapshot_observed_at":"2026-08-09T14:00:07.903618Z","submitted_at":"2025-09-08T23:44:00Z","title":"Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T22:33:28.907738Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2509.07287"},"observation_digest":"sha256:b7ad3afc97d4d1ff1245b56eb7236267286153261d9d74fbdc9a74f2c1994d45","observation_id":"3407591e-bc9f-4f12-bf67-eb608e0b06f3","resolution":{"observed_at":"2026-08-04T22:33:28.907738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2604.02574","last_updated":"2026-04-02T23:09:43Z","snapshot_observed_at":"2026-08-08T14:49:29.880831Z","submitted_at":"2026-04-02T23:09:43Z","title":"Understanding the Effects of Safety Unalignment on Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-13T20:37:45.061026Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2604.02574"},"observation_digest":"sha256:61e09132068ab2c264a67f427df90348e0fd8a23de55107e7215b62074a6e959","observation_id":"f39bbd99-254f-4599-8cfa-917f2b9d2688","resolution":{"observed_at":"2026-05-13T20:38:14.463635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2604.16659","last_updated":"2026-04-17T19:28:07Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T19:28:07Z","title":"Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T08:01:25.938248Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2604.16659"},"observation_digest":"sha256:c3bded1c8c0b7fafdfc3fe9465fd58ed24a3cab2973be5dc43c7b942c6c5d65e","observation_id":"51b9dee9-9552-4825-aa11-e8f2e9bbb3a6","resolution":{"observed_at":"2026-05-10T08:02:24.899967Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2604.18510","last_updated":"2026-04-20T17:01:27Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:01:27Z","title":"Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T04:24:25.964495Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2604.18510"},"observation_digest":"sha256:f18d0d5b1343b42e62a5851912caf959383fbdb1415ddd204bfb89e76d2afff0","observation_id":"422f1b45-3cb3-4390-9e7c-d6df5bc3ef48","resolution":{"observed_at":"2026-05-11T11:56:31.698001Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2604.21905","last_updated":"2026-04-23T17:50:23Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:50:23Z","title":"Low-Rank Adaptation Redux for Large Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-09T21:48:48.992712Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2604.21905"},"observation_digest":"sha256:42f6017dc04b53d2fd15398cbb98135c81aae7a9dfb1e9897634bf6d0e83e3b7","observation_id":"da4a9885-859d-4dbf-8363-6f186afdc9e5","resolution":{"observed_at":"2026-05-11T14:26:03.822655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2604.24902","last_updated":"2026-04-27T18:34:08Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T18:34:08Z","title":"Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T17:53:57.169962Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2604.24902"},"observation_digest":"sha256:98d45306c7012b6571adb8eef78882a2e7b8a1274e4f5a780561d061c2f0d17e","observation_id":"8a03f853-c1c6-4675-89be-89d7d32986a4","resolution":{"observed_at":"2026-05-11T23:11:19.248358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.04992","last_updated":"2026-05-06T14:52:22Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T14:52:22Z","title":"You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-08T17:02:20.836208Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.04992"},"observation_digest":"sha256:c352c570256465f87b2d40329482e58d094dfcc80331276ff536cd5e66e1ad03","observation_id":"0fc8591f-5942-4348-ae96-eb953144eb4b","resolution":{"observed_at":"2026-05-11T17:51:08.674491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.10998","last_updated":"2026-05-09T15:52:29Z","snapshot_observed_at":"2026-08-03T01:46:31.309604Z","submitted_at":"2026-05-09T15:52:29Z","title":"Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T07:06:46.387088Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.10998"},"observation_digest":"sha256:7709da6797d3d7cd9b156eec91bec376c79599f89611cd4fde20e05938006398","observation_id":"2d233b8b-046f-482e-86fd-c6c11a5a36ed","resolution":{"observed_at":"2026-05-13T07:07:27.074141Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.12850","last_updated":"2026-05-24T17:19:56Z","snapshot_observed_at":"2026-08-07T05:28:51.829684Z","submitted_at":"2026-05-13T00:48:57Z","title":"Persona-Model Collapse in Emergent Misalignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T20:44:09.214779Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.12850"},"observation_digest":"sha256:9d997465d54618b5d0d1dac6028e061637f6d9908c35fb19f491a591eb7e771d","observation_id":"d80882a7-057f-4b7e-8b5e-9fb5cb69ae57","resolution":{"observed_at":"2026-05-14T20:47:58.752995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.12850","last_updated":"2026-05-24T17:19:56Z","snapshot_observed_at":"2026-08-07T05:28:51.829684Z","submitted_at":"2026-05-13T00:48:57Z","title":"Persona-Model Collapse in Emergent Misalignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:29.444682Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.12850"},"observation_digest":"sha256:a307949ccb1d28b01cea4859c1790092b752281895583344721589ef30c369ec","observation_id":"006257a1-00c8-49c0-bb49-ba8b76145c5f","resolution":{"observed_at":"2026-07-01T14:15:47.617390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.14605","last_updated":"2026-05-24T08:34:13Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T09:22:14Z","title":"One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T21:01:25.549340Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.14605"},"observation_digest":"sha256:dd421845e3bf960ff449a26e76f7cbdf10db9027953e359011720464870a98b5","observation_id":"f51e1717-a090-434d-a1fa-d80497739ad6","resolution":{"observed_at":"2026-06-30T21:05:04.074611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.21674","last_updated":"2026-05-20T19:31:07Z","snapshot_observed_at":"2026-07-06T23:32:05.693503Z","submitted_at":"2026-05-20T19:31:07Z","title":"Adversarial Reframing: A Framework for Targeted Generation in Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T09:35:51.862736Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.21674"},"observation_digest":"sha256:c1b303243915ff7d3b8bbf1bf67f96bcd287eef9f63b75b136a9ea4334d30836","observation_id":"7b52221c-a0a7-4743-9217-5e493c2088d3","resolution":{"observed_at":"2026-05-22T09:36:21.008543Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.24550","last_updated":"2026-05-23T12:35:02Z","snapshot_observed_at":"2026-08-08T00:27:39.125477Z","submitted_at":"2026-05-23T12:35:02Z","title":"Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-30T12:58:50.713928Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.24550"},"observation_digest":"sha256:453caae2191be11f2e9397368f61d95369b45825423c818e4450d4cc89269e13","observation_id":"a77825fa-713f-43ea-b688-d21710ce826e","resolution":{"observed_at":"2026-06-30T13:04:40.288540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.24583","last_updated":"2026-05-31T07:57:23Z","snapshot_observed_at":"2026-08-05T18:42:16.201680Z","submitted_at":"2026-05-23T13:47:17Z","title":"Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T14:05:18.213065Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.24583"},"observation_digest":"sha256:7e8c04a6ae7fb15acdb96e15cca40693e1f3bc0759e262b26bc0342c0b6b08ef","observation_id":"fb7efac4-ad6d-4700-806d-b596f98a71b9","resolution":{"observed_at":"2026-06-30T14:14:45.888901Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.25073","last_updated":"2026-05-24T13:34:47Z","snapshot_observed_at":"2026-08-08T23:09:33.718132Z","submitted_at":"2026-05-24T13:34:47Z","title":"Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-29T23:51:05.413122Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.25073"},"observation_digest":"sha256:f087d09cc8c3ec7d0c558a29d98f9c119486bbf94f5402bb7c5c60ca65e83ce6","observation_id":"76c0ffc5-9fb8-420a-bd4e-450a48bf5004","resolution":{"observed_at":"2026-06-29T23:54:03.326066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.26315","last_updated":"2026-05-25T20:13:06Z","snapshot_observed_at":"2026-08-09T20:25:50.506661Z","submitted_at":"2026-05-25T20:13:06Z","title":"Curriculum Learning for Safety Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T22:25:31.739331Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.26315"},"observation_digest":"sha256:aab1715cab59a8748614cb57481cefeb190f6ab07a297f51ca240a71a1afc98c","observation_id":"e8bf7610-d2e3-4ecc-a0ea-df10c8c82bca","resolution":{"observed_at":"2026-06-29T22:34:02.186396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.26526","last_updated":"2026-05-26T04:18:42Z","snapshot_observed_at":"2026-08-03T14:37:23.753557Z","submitted_at":"2026-05-26T04:18:42Z","title":"Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T19:23:47.574214Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.26526"},"observation_digest":"sha256:f0694cbe67eeebadd506c75a160fdcf5e07d523dd70cd6642c227a391caeaf86","observation_id":"671d674a-6cd5-42cc-b508-bc3daa08761e","resolution":{"observed_at":"2026-06-29T19:23:53.626743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2605.28030","last_updated":"2026-05-27T06:36:22Z","snapshot_observed_at":"2026-08-07T03:38:26.044946Z","submitted_at":"2026-05-27T06:36:22Z","title":"SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:56.311711Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2605.28030"},"observation_digest":"sha256:0ac2033206c765d16b2f12b143632d38cb7f259e48c7cec3c3548f8ed857af74","observation_id":"4fe3cc67-1891-4f66-ace7-8f8b60f7b0ee","resolution":{"observed_at":"2026-06-29T13:53:28.681269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2606.00160","last_updated":"2026-05-29T09:04:27Z","snapshot_observed_at":"2026-08-02T07:42:30.512493Z","submitted_at":"2026-05-29T09:04:27Z","title":"DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T22:09:02.498712Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2606.00160"},"observation_digest":"sha256:11c52a9e127c0cec87d6f6325c8ed1782d900946285f92449732e26527f876e6","observation_id":"29586d0c-7565-48ab-9965-d676f03aa345","resolution":{"observed_at":"2026-07-01T19:46:10.225624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2606.07631","last_updated":"2026-05-31T04:28:21Z","snapshot_observed_at":"2026-08-07T01:48:42.889654Z","submitted_at":"2026-05-31T04:28:21Z","title":"Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T17:37:51.505359Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2606.07631"},"observation_digest":"sha256:d626b96417a3ba3ab6ddc3b4999e8089f32e443fa4d5d15bdc67c59dac2b2b3c","observation_id":"93a5ac7b-9a1f-40a6-af55-c8c43f8b5b4a","resolution":{"observed_at":"2026-07-01T20:56:13.872764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2606.17168","last_updated":"2026-06-20T10:01:32Z","snapshot_observed_at":"2026-08-08T12:13:21.907844Z","submitted_at":"2026-06-15T18:06:59Z","title":"RepSelect: Robust LLM Unlearning via Representation Selectivity","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T03:34:32.388152Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2606.17168"},"observation_digest":"sha256:c884dcec6c08f1efc579aa0cab93f7d6795c9105f537caff45c2cdc5f86aaaf1","observation_id":"d1f12f49-34ff-415b-8778-47ce65e5716a","resolution":{"observed_at":"2026-07-03T17:58:47.234243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2606.26620","last_updated":"2026-06-25T05:33:03Z","snapshot_observed_at":"2026-08-07T13:16:24.780198Z","submitted_at":"2026-06-25T05:33:03Z","title":"Discovering Millions of Interpretable Features with Sparse Autoencoders","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T05:34:00.754172Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2606.26620"},"observation_digest":"sha256:6e61a4fa990668924f5f7e3da45d5244140c63b24e261f84ec77eff14e3ff22b","observation_id":"0d16d39a-46d0-490c-bbfe-bfd4c1cd6bda","resolution":{"observed_at":"2026-07-04T12:59:53.052072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":"2310.20624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-04T12:59:53.050459Z","title":"Lora fine-tuning efficiently undoes safety training in llama 2-chat 70b","venue":null,"work_id":"749e51cb-5b16-4d39-855d-39aeb9e391e2","year":2024},"citing_paper":{"arxiv_id":"2606.28843","last_updated":"2026-06-27T10:05:36Z","snapshot_observed_at":"2026-08-06T01:43:50.220962Z","submitted_at":"2026-06-27T10:05:36Z","title":"The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-30T09:52:42.862423Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2606.28843"},"observation_digest":"sha256:f71914e3d2bc18843a6274e8c90bcab38785558af8c7ba2b5e38b7decfe836a4","observation_id":"7763be8f-401c-46ff-834f-475b65181e5f","resolution":{"observed_at":"2026-06-30T09:54:34.733665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-07-12T07:33:43.015966Z","title":"LoRA fine-tuning efficiently undoes safety training in Llama 2-Chat 70B.arXiv preprint arXiv:2310.20624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02714","last_updated":"2026-07-07T12:39:55Z","snapshot_observed_at":"2026-08-07T02:57:17.862073Z","submitted_at":"2026-07-02T19:05:07Z","title":"Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T07:33:43.015966Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2607.02714"},"observation_digest":"sha256:5d2ece46998363ed251bfc71ff171f2182cd22e6e12be8c77099240814af398b","observation_id":"150f3f6e-8b64-4988-9ed7-8e975ea53f56","resolution":{"observed_at":"2026-07-12T07:33:43.015966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-02T10:00:11.935152Z","title":"Lora fine-tuning effi- ciently undoes safety training in llama 2-chat 70b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16242","last_updated":"2026-06-26T03:29:59Z","snapshot_observed_at":"2026-08-06T19:59:54.568684Z","submitted_at":"2026-06-26T03:29:59Z","title":"TRACE: Trajectory-Based Safety Patch Learning for LLM Post-Training Realignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T10:00:11.935152Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2607.16242"},"observation_digest":"sha256:0deec4da3abbafed7ea9a07c1f7a34fb505236ee925863cbb99a7864e350f329","observation_id":"a946a932-8846-47e0-af95-2f39d7873f13","resolution":{"observed_at":"2026-08-02T10:00:11.935152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-02T07:44:09.563432Z","title":"LoRA fine-tuning efficiently undoes safety training in Llama 2-chat 70b.arXiv preprint arXiv:2310.20624,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22676","last_updated":"2026-07-10T11:11:48Z","snapshot_observed_at":"2026-08-09T15:01:07.301863Z","submitted_at":"2026-07-10T11:11:48Z","title":"How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.563432Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2607.22676"},"observation_digest":"sha256:1eae778be49bdb9ed40d24700ab7f0ccb8efb3fd3f80f34a3fd7bed82bd301f5","observation_id":"ed4e70e1-67fb-424a-937f-79b556eadb57","resolution":{"observed_at":"2026-08-02T07:44:09.563432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.20624/citation-record","integrity":"/paper/2310.20624/integrity","json":"/paper/2310.20624/citation-record.json","paper":"/paper/2310.20624"},"outbound":[],"paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 41 inbound Pith citation observations for arXiv:2310.20624."}