{"as_of":"2026-08-05T14:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d35723b7aa94410eebf2d2d33f67bd6bfd7f492c6af3c28fdb97d1c53fcf439","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T08:58:35.714394Z","state":"measured"},{"denominator":138,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":138,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":104,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:42:31.477122Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":40,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-11T00:14:14.079351Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2308.10248"},"observation_digest":"sha256:2023a54265e136a4ca42e674796ed0601f69675e1726c1ffeb67f51f9bdea9e3","observation_id":"c832233a-a906-402d-a3d2-464e9f75c21e","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T21:28:02.745230Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2402.10260"},"observation_digest":"sha256:ed6e283a7df21f8a8a7d9d0ad36d797cc257391b10899ea4b4995d2742862be0","observation_id":"5e5f6c77-6403-4566-8f76-3d32d26c36eb","resolution":{"observed_at":"2026-05-16T21:28:02.849519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2404.08144","last_updated":"2024-04-17T04:34:39Z","snapshot_observed_at":"2026-08-02T04:29:28.130280Z","submitted_at":"2024-04-11T22:07:19Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T04:18:27.597704Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2404.08144"},"observation_digest":"sha256:1cb75ca1a0ed89fac80c58274bff40888abb99a81543913518f1d436c78ad1e4","observation_id":"a279ad45-9fbe-42de-b9b5-6931bf327e13","resolution":{"observed_at":"2026-05-18T04:18:27.728190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2405.13068","last_updated":"2026-04-18T08:25:50Z","snapshot_observed_at":"2026-08-04T20:18:53.393132Z","submitted_at":"2024-05-20T17:17:55Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T00:38:36.992597Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2405.13068"},"observation_digest":"sha256:f23cfdc246e8013b3a50d841661ddb28e8033187a425658dcf5d5000443af136","observation_id":"04d77622-8cdf-4c1d-ba4d-372b9be72d03","resolution":{"observed_at":"2026-05-24T00:38:39.894564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-07-29T20:40:25.374189Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"reference_index":217,"source":"pdf_text","source_observed_at":"2026-05-13T20:18:06.304134Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2406.00515"},"observation_digest":"sha256:25836ff00fc75a21d59382872f7b7b383b749f9289b92a8f0790acea4267a3d2","observation_id":"b5877a39-b497-4372-abe0-be12c6b90e61","resolution":{"observed_at":"2026-05-13T20:18:06.587830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-05-13T10:47:55.934081Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2406.11717"},"observation_digest":"sha256:e62e77008539eace742f6b3e68c3ff2b53b26b623b1dba3acf14a9ca0983dea5","observation_id":"5e00ce49-f29c-416a-ab83-e6423981634e","resolution":{"observed_at":"2026-05-13T10:47:56.085892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:bd21ea0c376d3e34968cfb413e6b400caf0853da4a4932c061e90fe4fbc82dbe","observation_id":"4d0a6145-4a05-4060-baf2-70d4d3695e29","resolution":{"observed_at":"2026-05-15T02:20:44.791796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-23T20:58:16.237327Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2409.18169"},"observation_digest":"sha256:063ce8b6f3f47e5a798858a2f0956ec700b94766810674d95e7fbd02b85643de","observation_id":"e1db6ec5-66f7-4ac4-9189-028dde1d878f","resolution":{"observed_at":"2026-05-23T20:58:26.080331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:be70a30e78026be8607743194883f7ec0bbf5dd0b390566dafd1c7a7fd06231b","observation_id":"835096e9-28fb-48b8-a2f6-0b9a7610125a","resolution":{"observed_at":"2026-05-23T04:42:34.192432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2506.06414","last_updated":"2026-04-20T20:58:30Z","snapshot_observed_at":"2026-08-03T02:03:44.971897Z","submitted_at":"2025-06-06T17:33:33Z","title":"Benchmarking Misuse Mitigation Against Covert Adversaries","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T10:29:05.104520Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2506.06414"},"observation_digest":"sha256:968347fa189f8e3cf8d6c7577d413ed3b72e4bfc2ff1cae3a52ba057b4815ce5","observation_id":"dc057248-27cc-414b-8343-b31e3dd7d049","resolution":{"observed_at":"2026-05-19T10:32:14.757643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2507.05660","last_updated":"2026-05-21T16:31:21Z","snapshot_observed_at":"2026-07-29T18:54:03.959574Z","submitted_at":"2025-07-08T04:40:09Z","title":"Optimus: A Robust Defense Framework for Mitigating Toxicity while Fine-Tuning Conversational AI","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T12:17:59.458633Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2507.05660"},"observation_digest":"sha256:81c60d9f80dde102f41ea08bcca7625b50f9a9dabaa6f7fa75e7480203e59430","observation_id":"9c9239d6-86f3-4122-b575-dee14ea3cc8a","resolution":{"observed_at":"2026-05-22T12:21:31.183653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2507.21509","last_updated":"2025-09-05T07:44:31Z","snapshot_observed_at":"2026-07-31T17:57:12.284928Z","submitted_at":"2025-07-29T05:20:14Z","title":"Persona Vectors: Monitoring and Controlling Character Traits in Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T14:28:17.516153Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2507.21509"},"observation_digest":"sha256:13123baa460dfa09d52afac4dde550fc40e99b10dc4a063b8704e79f03441154","observation_id":"da0a4603-03bc-4059-bd61-3ea490a06290","resolution":{"observed_at":"2026-05-12T14:28:17.619371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T14:42:31.477122Z","title":"Fine- tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21004","last_updated":"2025-08-28T17:05:18Z","snapshot_observed_at":"2026-08-05T14:42:29.954589Z","submitted_at":"2025-08-28T17:05:18Z","title":"Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:31.477122Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2508.21004"},"observation_digest":"sha256:522862aba7515e96514126aadd2170ed0c9c9fa44496751931100bc3f968536d","observation_id":"8e0e67b8-214b-4116-a4fc-df9b9dfd9e2f","resolution":{"observed_at":"2026-08-05T14:42:31.477122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T12:52:56.299514Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!, October 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01186","last_updated":"2025-09-01T07:10:22Z","snapshot_observed_at":"2026-08-05T12:52:51.621001Z","submitted_at":"2025-09-01T07:10:22Z","title":"Statutory Construction and Interpretation for Artificial Intelligence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:56.299514Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2509.01186"},"observation_digest":"sha256:278afb1f70c5bc0851786e9d68da4ea036f9391281b35a8bef82d08860d51477","observation_id":"8e5229e9-fab2-427e-8a37-8fc151c8d1f7","resolution":{"observed_at":"2026-08-05T12:52:56.299514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-04T23:10:21.130924Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06795","last_updated":"2025-09-08T15:24:33Z","snapshot_observed_at":"2026-08-04T23:10:17.174121Z","submitted_at":"2025-09-08T15:24:33Z","title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:10:21.130924Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2509.06795"},"observation_digest":"sha256:cc9ff217cc925f4c06e322ccdc0e30d92b9b17970a41719a19985dd9f01a77d1","observation_id":"e2582bd1-acdd-46b5-a110-ca4c4e69ec43","resolution":{"observed_at":"2026-08-04T23:10:21.130924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-04T23:09:41.448210Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-04T23:09:39.534978Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.448210Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:46e91e3904642620ba854a2437871c1e602fc9bf9da4e9c8fc73458d016b3ccf","observation_id":"8f4adb80-c946-4fdf-a9cc-2de908f44f53","resolution":{"observed_at":"2026-08-04T23:09:41.448210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-04T22:33:23.105788Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07287","last_updated":"2025-09-08T23:44:00Z","snapshot_observed_at":"2026-08-04T22:33:19.052966Z","submitted_at":"2025-09-08T23:44:00Z","title":"Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T22:33:23.105788Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2509.07287"},"observation_digest":"sha256:3e6fdfc80b19e487e86bec6588d8e290c619af76f0b27bea963146ac12dfa6ea","observation_id":"0267baf5-bf0c-4c31-809c-cafde7b5d777","resolution":{"observed_at":"2026-08-04T22:33:23.105788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-04T11:19:21.574735Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05743","last_updated":"2026-07-19T04:13:21Z","snapshot_observed_at":"2026-08-04T11:18:57.167765Z","submitted_at":"2025-10-07T10:02:17Z","title":"Artificially intelligent agents in the social and behavioral sciences: A history and outlook","version":3},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-08-04T11:19:21.574735Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2510.05743"},"observation_digest":"sha256:38eea0d99b7ebd423d714543e824020e95a1762c51003d3964a81eeb533b869b","observation_id":"80f8ba22-9259-4d9e-a0c9-767d0e209c0a","resolution":{"observed_at":"2026-08-04T11:19:21.574735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-04T08:49:33.704292Z","title":"Fine‑tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.18874","last_updated":"2026-06-26T02:22:44Z","snapshot_observed_at":"2026-08-04T15:02:09.340673Z","submitted_at":"2025-10-21T17:59:41Z","title":"Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T08:49:33.704292Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2510.18874"},"observation_digest":"sha256:1a233bb759d09096d275ae4e435ec2d8e085cb36d6164f88631f61dd62f92e50","observation_id":"fb500d52-2c33-40e3-94fb-7046bf418b28","resolution":{"observed_at":"2026-08-04T08:49:33.704292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2511.02356","last_updated":"2026-04-20T12:25:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-04T08:24:22Z","title":"ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T01:54:22.995178Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2511.02356"},"observation_digest":"sha256:a377bc838d30a0062e3a46ef29301c9da38091abd558dcf436f65a3c028728d9","observation_id":"b98212e5-803b-49fd-be01-13c8b4809e30","resolution":{"observed_at":"2026-05-18T01:55:38.077788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T22:29:36.960961Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2511.10287"},"observation_digest":"sha256:d3673d678804da696987dc053d2250ecf0df628c2ce0e63bb675117055ca3ebb","observation_id":"44d68da1-b45e-4ec9-94fb-ea9daa82f868","resolution":{"observed_at":"2026-05-17T22:30:23.217680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2512.20798","last_updated":"2026-05-10T00:05:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-23T21:52:53Z","title":"A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-16T20:07:50.879922Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2512.20798"},"observation_digest":"sha256:b34e99df03064152d160a560cd71c6345279bb46a90faf72fafd32c724fc970b","observation_id":"0e650af1-43ad-4044-b48b-425a187e59de","resolution":{"observed_at":"2026-05-16T20:08:22.531055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2601.21692","last_updated":"2026-05-22T01:46:45Z","snapshot_observed_at":"2026-08-02T10:02:20.704165Z","submitted_at":"2026-01-29T13:26:29Z","title":"TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T07:33:15.865358Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2601.21692"},"observation_digest":"sha256:09f803b4d9b4f9adad848c01f2f00ea8ed19edbdc08980b11e735049cffb818e","observation_id":"30e892a5-2402-47e8-b4cd-dffd49e33961","resolution":{"observed_at":"2026-05-25T07:35:28.652933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-03T06:12:38.160707Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:c11050263b52c45ffc0392968a87cd769456bd03ba34c431ccf3e9fbe8028682","observation_id":"60fc2eed-06da-449b-8601-336ebe4ed3bd","resolution":{"observed_at":"2026-05-16T05:37:24.284160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-03T01:12:14.203088Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10382","last_updated":"2026-07-20T12:19:57Z","snapshot_observed_at":"2026-08-04T14:40:37.630488Z","submitted_at":"2026-02-11T00:04:32Z","title":"Language Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T01:12:14.203088Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2602.10382"},"observation_digest":"sha256:53088b7d03f98eebc3f54f49418b2ca7ff6338fefcf3bffb832ec90a9300785d","observation_id":"353106d4-0f4e-4546-9654-83587f94402d","resolution":{"observed_at":"2026-08-03T01:12:14.203088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-03T01:03:26.620536Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10778","last_updated":"2026-05-29T10:02:55Z","snapshot_observed_at":"2026-08-03T01:03:25.323679Z","submitted_at":"2026-02-11T12:10:14Z","title":"GoodVibe: Security-by-Vibe for LLM-Based Code Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T01:03:26.620536Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2602.10778"},"observation_digest":"sha256:d79cf236f503814a3cdebb74d8541da98617a1b5802e486335065386f3b6fee4","observation_id":"1ed04bff-1592-4333-bb14-6df82440f5cb","resolution":{"observed_at":"2026-08-03T01:03:26.620536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2602.11157","last_updated":"2025-12-08T06:48:17Z","snapshot_observed_at":"2026-08-04T23:09:56.365393Z","submitted_at":"2025-12-08T06:48:17Z","title":"Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T01:27:16.967080Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2602.11157"},"observation_digest":"sha256:f507368c2bf4d6637c51cc109a8826cb015638f99e3e9169c97bf0db4b315df7","observation_id":"d89dd5ea-e13e-448e-a0ed-f9aa2d516823","resolution":{"observed_at":"2026-05-17T01:28:48.809289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.04120","last_updated":"2026-04-05T13:43:12Z","snapshot_observed_at":"2026-07-06T22:53:10.816748Z","submitted_at":"2026-04-05T13:43:12Z","title":"Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T17:16:47.284564Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.04120"},"observation_digest":"sha256:eb150cf284f6dde389c112ab94cbe657a0640563d1cf10e43347962ea76f168e","observation_id":"992a1ed6-248d-4637-a459-1861d1822d53","resolution":{"observed_at":"2026-05-13T17:18:01.271964Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.05179","last_updated":"2026-04-06T21:19:28Z","snapshot_observed_at":"2026-07-06T22:54:00.211106Z","submitted_at":"2026-04-06T21:19:28Z","title":"Gradient-Controlled Decoding: A Safety Guardrail for LLMs with Dual-Anchor Steering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T19:00:53.538335Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.05179"},"observation_digest":"sha256:211b99b98e8292f7981eadb9b642bd1ad3e0126c3f69831ba1cefc08e7fc06a4","observation_id":"7bf50010-2ab4-46f7-b0a2-9ae0334a7392","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.05485","last_updated":"2026-04-07T06:25:49Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:25:49Z","title":"Auditable Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T19:18:12.041351Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.05485"},"observation_digest":"sha256:f6bea97bc0d98489dde393397c03a3bb1a15e29f8bf0134025b76e75c9e6e909","observation_id":"fa7c562b-1722-45c8-829d-6b331079f32e","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.07727","last_updated":"2026-04-09T02:22:44Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T02:22:44Z","title":"TrajGuard: Streaming Hidden-state Trajectory Detection for Decoding-time Jailbreak Defense","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:19.922383Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.07727"},"observation_digest":"sha256:9a4abf1ca1103a79aabee60c493204605c132c7c31e985a9ed07bd545c1d15ae","observation_id":"9de7ded4-16b4-40e3-b13c-00131d1c4f49","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.07831","last_updated":"2026-04-09T05:32:34Z","snapshot_observed_at":"2026-08-02T13:15:13.204183Z","submitted_at":"2026-04-09T05:32:34Z","title":"Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T18:29:27.373741Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.07831"},"observation_digest":"sha256:ca5577f825a2550aac56366961b15a74d3bc3ad8ea37592d76dcd03875b8c285","observation_id":"1c48a576-9ed9-4526-b042-c54b9574c974","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.09378","last_updated":"2026-04-10T14:48:29Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T14:48:29Z","title":"BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:24.662459Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.09378"},"observation_digest":"sha256:438616d4f0baaf4d1aa4d91596481bb10b545bcae988ae75df41477f48538007","observation_id":"054708f6-9abf-409f-80fe-af2c5493d257","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.09688","last_updated":"2026-04-06T09:30:49Z","snapshot_observed_at":"2026-07-06T22:58:29.952947Z","submitted_at":"2026-04-06T09:30:49Z","title":"Immunizing 3D Gaussian Generative Models Against Unauthorized Fine-Tuning via Attribute-Space Traps","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T19:30:06.396482Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.09688"},"observation_digest":"sha256:e2465f0e771039520ce786fef599274bc776eead7bbe14d15d4e907c52fcf618","observation_id":"f9c92b85-a869-43fe-a9e8-2722ef5c619e","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.10022","last_updated":"2026-05-04T15:06:08Z","snapshot_observed_at":"2026-07-30T08:17:29.397155Z","submitted_at":"2026-04-11T04:28:52Z","title":"Weird Generalization is Weirdly Brittle","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:33.646021Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.10022"},"observation_digest":"sha256:c7ef3f1be4bf2b17c4b4828e7195b65d6fb7411ead00f2b49eee91797b617de4","observation_id":"0f93a687-eaed-4e11-821e-0c01205c8584","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-05T14:16:47.343683Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:50.762366Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:21239441f8107aa12a7b8927cbe614856a512b8fdc98e6d722a1cb9cd8902d63","observation_id":"dc89e5dd-fe53-4ff2-818a-65de329ce095","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-03T00:19:58.926751Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-05T14:16:47.343683Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T00:19:58.926751Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:e47f21f8716249861d8915ee5fed0af82fcc43fb5a2c8a040552eb3a0681c64d","observation_id":"1c8239fe-6631-46a4-8425-2962b9374080","resolution":{"observed_at":"2026-08-03T00:19:58.926751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.16659","last_updated":"2026-04-17T19:28:07Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T19:28:07Z","title":"Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T08:01:25.938248Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.16659"},"observation_digest":"sha256:6f3f3348949d56e0bd85774f91f1572aa2cf335f0cdaed7866200b7725420681","observation_id":"5b4ae1cd-2c0d-4bf6-8f2a-ea125af7d1b7","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.17396","last_updated":"2026-04-19T11:59:58Z","snapshot_observed_at":"2026-08-01T18:23:32.699442Z","submitted_at":"2026-04-19T11:59:58Z","title":"Representation-Guided Parameter-Efficient LLM Unlearning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T06:01:46.885030Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.17396"},"observation_digest":"sha256:dfabd43cae0ac293ae21faaabb568c677ca6dabee0ad8be7c90c3e49a7e02ee0","observation_id":"f477c1d0-d034-4ce6-a716-e29d66c5f229","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.17769","last_updated":"2026-04-20T03:49:25Z","snapshot_observed_at":"2026-07-06T23:04:46.497227Z","submitted_at":"2026-04-20T03:49:25Z","title":"Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-10T04:35:51.223025Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.17769"},"observation_digest":"sha256:7f32826f77b677650d447e4b60d24838470957b2be41a5f3f24f9e6b5004d1b9","observation_id":"b58299a0-9735-4b4f-be54-4b023f0b4442","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.18510","last_updated":"2026-04-20T17:01:27Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:01:27Z","title":"Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T04:24:25.964495Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.18510"},"observation_digest":"sha256:e2e992f87e327a805632239cfc563a2417137dcc937139d837b3ceccc0672d13","observation_id":"a143bcf4-2eda-4684-bb5d-97ca8a807da8","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.19790","last_updated":"2026-04-02T03:38:47Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-02T03:38:47Z","title":"Hidden Reliability Risks in Large Language Models: Systematic Identification of Precision-Induced Output Disagreements","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T21:59:42.435082Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.19790"},"observation_digest":"sha256:1c5ec632e145c2ecf0209aac2abc987b6484708de654a0d9a180c657838c73b7","observation_id":"229b4edb-9aae-44b6-ac68-961c5e10badf","resolution":{"observed_at":"2026-05-13T22:03:20.498819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.23338","last_updated":"2026-05-06T17:17:02Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:57:15Z","title":"A Systematic Survey of Security Threats and Defenses in LLM-Based AI Agents: A Layered Attack Surface Framework","version":2},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-08T07:53:13.746141Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.23338"},"observation_digest":"sha256:dfe0fa9b771a115afccf3018107c889fd79d75e326c0c8d53273f728637c2f20","observation_id":"4b556914-6dac-4610-954c-7146531dbb4c","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2604.24966","last_updated":"2026-04-27T20:07:09Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:07:09Z","title":"Risk Reporting for Developers' Internal AI Model Use","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T17:47:21.321820Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2604.24966"},"observation_digest":"sha256:ca1411f5bfaa81b70d5dab46e7841e283ae5c7a46fe6bb39bf1396cf469ffeb3","observation_id":"843c8846-f185-4491-8680-6cb3b2f27142","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.01462","last_updated":"2026-05-02T14:25:26Z","snapshot_observed_at":"2026-07-06T23:14:43.034336Z","submitted_at":"2026-05-02T14:25:26Z","title":"LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T14:17:57.772960Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.01462"},"observation_digest":"sha256:67682c494f135e0e77b8a8d4e1286271eaa514d1dea31857553bcc9a9572dc83","observation_id":"64c7377c-3f60-4d94-b540-987d63864412","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:77ce2f3e2a2a7fa6a1de9c2774cae027c2497595dac7e741402e1e8e49c1be10","observation_id":"5cc4aa8d-625b-4899-89a0-bb40273b0134","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.01913","last_updated":"2026-05-03T14:48:18Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:48:18Z","title":"RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:47:30.890858Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.01913"},"observation_digest":"sha256:d259ae0f690b005d233bd3cc742201668fc6595f92cdcfdc32ecd553ba4c4753","observation_id":"817189fe-1819-418e-8b44-911d8872d086","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.02914","last_updated":"2026-04-08T05:27:33Z","snapshot_observed_at":"2026-08-02T18:20:53.616601Z","submitted_at":"2026-04-08T05:27:33Z","title":"When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:43:12.298529Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.02914"},"observation_digest":"sha256:115f7b9690a09103de3b81356d2f0ff46a3d829a7f2d89202da85dab85c5cf49","observation_id":"3871e13b-d7c0-4373-a4c9-cc84c869f250","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.04446","last_updated":"2026-05-06T03:21:38Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T03:21:38Z","title":"Misrouter: Exploiting Routing Mechanisms for Input-Only Attacks on Mixture-of-Experts LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T18:07:00.247161Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.04446"},"observation_digest":"sha256:6f18983adea297320edebe6e5f0a07a1f870aaa3b3de702f66c23c507311459c","observation_id":"2c002243-bc63-4fa1-a95f-56175af3fde6","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.04572","last_updated":"2026-05-06T07:17:33Z","snapshot_observed_at":"2026-08-01T20:51:20.997015Z","submitted_at":"2026-05-06T07:17:33Z","title":"From Parameter Dynamics to Risk Scoring : Quantifying Sample-Level Safety Degradation in LLM Fine-tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T18:08:11.122577Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.04572"},"observation_digest":"sha256:c207813e6ad036d5093921af655e264463afae1389733cb6a55ccdb99a17b071","observation_id":"7d397fb7-4190-4a9d-a1a8-4d3032723356","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.04970","last_updated":"2026-05-19T15:43:44Z","snapshot_observed_at":"2026-08-01T20:00:44.538118Z","submitted_at":"2026-05-06T14:27:12Z","title":"Skill Neologisms: Towards Skill-based Continual Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T17:24:42.926961Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.04970"},"observation_digest":"sha256:f60e5e053909b3d6c70340ca2c5f004005f0c00e471068557a4a4707ba2bf8cd","observation_id":"ad1bd836-1259-4ef1-b6cc-3b30976d0c65","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.04992","last_updated":"2026-05-06T14:52:22Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T14:52:22Z","title":"You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-08T17:02:20.836208Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.04992"},"observation_digest":"sha256:9900d286638055c8051cbf5c9b77919dd1c63779543356efd474cb8d1c874661","observation_id":"8a70dddb-b48f-4b58-88ca-55c4e63616c2","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.08496","last_updated":"2026-05-08T21:21:59Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T21:21:59Z","title":"Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:46:49.586630Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.08496"},"observation_digest":"sha256:0f199376d45b0259435e918d83c117f3708f7864fcb6e1f906becd1972ceb83c","observation_id":"5ed54a87-6b21-414d-8e7f-bd6bf7cba1a0","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.09397","last_updated":"2026-05-10T07:50:02Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T07:50:02Z","title":"BadDLM: Backdooring Diffusion Language Models with Diverse Targets","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:13.417357Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.09397"},"observation_digest":"sha256:52cfb4cf17120146eefcd1fbe5f0b983f6f9450fb50da7887c1151863e3efb56","observation_id":"7ebf7873-8a72-4a9a-8d3f-8d6a41a205bd","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.11685","last_updated":"2026-05-12T07:43:46Z","snapshot_observed_at":"2026-08-04T23:07:28.175475Z","submitted_at":"2026-05-12T07:43:46Z","title":"Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T01:06:44.126131Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.11685"},"observation_digest":"sha256:1ce92f9596c8562398b6568d222df96b83d5f502962243189a03457840e36895","observation_id":"142a2489-dd26-4274-81cc-310c6319b05d","resolution":{"observed_at":"2026-05-13T01:07:00.013843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.12705","last_updated":"2026-05-12T20:08:00Z","snapshot_observed_at":"2026-08-01T18:42:35.047789Z","submitted_at":"2026-05-12T20:08:00Z","title":"Early Data Exposure Improves Robustness to Subsequent Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T20:45:27.673290Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.12705"},"observation_digest":"sha256:e10430b011ea95a1f23da9667a5b2d84b7cbd9dc4d08968a1d52ecfa4b5f65d0","observation_id":"f8d9fa37-ab95-4dd2-921c-daeb6cb3033c","resolution":{"observed_at":"2026-05-14T20:47:58.499743Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.13634","last_updated":"2026-05-13T15:00:29Z","snapshot_observed_at":"2026-07-06T23:25:11.623026Z","submitted_at":"2026-05-13T15:00:29Z","title":"Europe and the Geopolitics of AGI: The Need for a Preparedness Plan","version":1},"reference_index":239,"source":"pdf_text","source_observed_at":"2026-05-14T17:43:38.233339Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.13634"},"observation_digest":"sha256:137164b64d4f67d40fc76caee2fa30ecb7b945a207770baa4725fd3fd7c42fd8","observation_id":"84974cad-b0f1-4fef-ab68-edd511a29223","resolution":{"observed_at":"2026-05-14T17:47:32.171851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.14514","last_updated":"2026-05-14T07:58:47Z","snapshot_observed_at":"2026-07-06T23:25:54.070869Z","submitted_at":"2026-05-14T07:58:47Z","title":"Defenses at Odds: Measuring and Explaining Defense Conflicts in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T01:43:22.777232Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.14514"},"observation_digest":"sha256:80dfeaa1a50e3df2c9d183b2c5a310ea012eba62bef845809b4e5e63a0370cf6","observation_id":"93d55858-7436-43b7-a0c6-31f9190ab483","resolution":{"observed_at":"2026-05-15T01:43:27.370114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.14605","last_updated":"2026-05-24T08:34:13Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T09:22:14Z","title":"One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T21:01:25.549340Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.14605"},"observation_digest":"sha256:12ea7e37f3b99bd5fe201209d8e90353d75eecff0c66dce84ae18f69e5baa0f3","observation_id":"9295cc66-fe9a-44f4-a5eb-d0715e4dee14","resolution":{"observed_at":"2026-06-30T21:05:04.088787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.15152","last_updated":"2026-06-03T16:04:16Z","snapshot_observed_at":"2026-08-01T11:20:48.080521Z","submitted_at":"2026-05-14T17:50:39Z","title":"Widening the Gap: Exploiting LLM Quantization via Outlier Injection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:45.542409Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.15152"},"observation_digest":"sha256:a8d39212ddd5447f2b58725c4fa525b18172ac4aa8a64f5c420c1c3a7ad0e5e9","observation_id":"410c83c9-c2fe-4304-bc9c-c96376621dc2","resolution":{"observed_at":"2026-06-30T21:05:04.618116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.15239","last_updated":"2026-05-14T03:40:07Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-05-14T03:40:07Z","title":"Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-19T16:34:47.856606Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.15239"},"observation_digest":"sha256:2e8098fd20c3fb7074eb69762e113b50e03264ca78905409eee4bcb8b6579f4c","observation_id":"66d46433-fcf6-4cf6-86b4-75736e1d4b03","resolution":{"observed_at":"2026-05-19T16:37:39.891487Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.15384","last_updated":"2026-05-14T20:15:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T20:15:22Z","title":"Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T16:43:37.472644Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.15384"},"observation_digest":"sha256:0571aa72bd6cb81763262a865c1bf0628120da9b0fdb494792901bf48b79bfb9","observation_id":"89299ff7-09d0-4bc0-9549-270c0606f9a1","resolution":{"observed_at":"2026-05-19T16:47:40.504096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.16471","last_updated":"2026-05-15T13:53:02Z","snapshot_observed_at":"2026-07-06T23:27:38.955917Z","submitted_at":"2026-05-15T13:53:02Z","title":"From AI-Generated Content to Agentic Action: Security and Safety Threats in Generative AI","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-20T18:08:24.901025Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.16471"},"observation_digest":"sha256:e084848231c881cd3514f680f088f60045f074310d53fae40e25445961197f92","observation_id":"c93ab047-d1a0-49c4-86ce-c34161b8653b","resolution":{"observed_at":"2026-05-20T18:08:50.445752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.16776","last_updated":"2026-05-16T03:15:35Z","snapshot_observed_at":"2026-08-01T18:28:14.332482Z","submitted_at":"2026-05-16T03:15:35Z","title":"Distinguishable Deletion: Unifying Knowledge Erasure and Refusal for Large Language Model Unlearning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-19T21:49:07.440832Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.16776"},"observation_digest":"sha256:571a0b91649bddc38eddb7df35ef05e9c846f98ade63c559888114e87c175e91","observation_id":"8df9271f-d257-4261-a55e-f1a0d6231935","resolution":{"observed_at":"2026-05-19T21:52:48.324030Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:e31712771c6f73dc9a9c4624ecab3bef4069faaff1e7ac71f05fa9ffef34b47a","observation_id":"0ca43b31-5dad-4cb7-b1ed-b6cfed1821fb","resolution":{"observed_at":"2026-05-19T23:32:52.569631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:41443381ed416181af1108405bef5aae8f23658a80deca3c00b55161d3a4765d","observation_id":"25a0cf93-1aaa-4371-8f00-38b4c56b6602","resolution":{"observed_at":"2026-05-20T10:23:12.289767Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.20005","last_updated":"2026-05-19T15:36:52Z","snapshot_observed_at":"2026-07-06T23:30:39.512029Z","submitted_at":"2026-05-19T15:36:52Z","title":"Fine-Tuning Without Forgetting via Loss-Adaptive Learning Rates","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T07:14:59.396900Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.20005"},"observation_digest":"sha256:7042b89087fcaea4cf825136d647d9c62665e66dbc63432b54ddc1fdf7b0b420","observation_id":"1ca6e224-541c-403b-a125-61e3f50a46d1","resolution":{"observed_at":"2026-05-20T07:18:07.056864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.20296","last_updated":"2026-05-19T11:01:39Z","snapshot_observed_at":"2026-08-03T21:35:51.861909Z","submitted_at":"2026-05-19T11:01:39Z","title":"Spectral Unforgetting: Post-Hoc Recovery of Damaged Capabilities Without Retraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T07:49:13.043266Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.20296"},"observation_digest":"sha256:5ea98067ab8c0476e676e2cbeea6d3393ff8ade25a60d8a66cb8e7be7ca4b17d","observation_id":"4e5dcc09-18cb-4f8b-9f5f-2fb795cd8f48","resolution":{"observed_at":"2026-05-21T07:49:49.820916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.20641","last_updated":"2026-05-20T02:55:56Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T02:55:56Z","title":"Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T04:45:35.079192Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.20641"},"observation_digest":"sha256:35edd8baa83657bf74982265577242b426a53b350e708daa9ceb681520997056","observation_id":"ef9d3582-8ad3-4552-a28c-981a9fc2e29a","resolution":{"observed_at":"2026-05-21T04:49:35.680833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.23040","last_updated":"2026-05-21T21:13:14Z","snapshot_observed_at":"2026-08-02T04:36:31.374601Z","submitted_at":"2026-05-21T21:13:14Z","title":"Steered Generation via Gradient-Based Optimization on Sparse Query Features","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T05:31:29.510639Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.23040"},"observation_digest":"sha256:61d1d41813df130d437e6607f99379a341ca2f10f62c59a63846d0b3f8a555ef","observation_id":"22cbec01-b95e-403d-bddb-54aa91cfece0","resolution":{"observed_at":"2026-05-25T05:36:40.389189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.24154","last_updated":"2026-05-22T19:22:17Z","snapshot_observed_at":"2026-07-06T23:34:13.859813Z","submitted_at":"2026-05-22T19:22:17Z","title":"Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T16:03:12.728352Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.24154"},"observation_digest":"sha256:4ba3a0d77d22b780d66e5166c31ceb32c7e0f388f22547542086b94b7d52387b","observation_id":"ea936d09-e6bf-4950-8699-de4b44c1d95f","resolution":{"observed_at":"2026-06-30T16:04:52.565167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.28896","last_updated":"2026-05-27T11:54:23Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-27T11:54:23Z","title":"Feature Geometry of LoRA Adapters: A Sparse Autoencoder Analysis of Representational Divergence in Fine-Tuned Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T13:48:36.304776Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.28896"},"observation_digest":"sha256:fcb1eb8fe755e8020f84853344ed914455179bd627685e4811043ce6c961e4d5","observation_id":"b5d45ef9-b1b8-4e16-a011-caccea834bd7","resolution":{"observed_at":"2026-06-29T13:53:28.775569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-07-13T18:51:10.298187Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00003","last_updated":"2026-03-25T15:36:15Z","snapshot_observed_at":"2026-07-13T18:51:10.077827Z","submitted_at":"2026-03-25T15:36:15Z","title":"Learning from Mistakes: Can LLM Self-Recover after Misalignment?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T18:51:10.298187Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.00003"},"observation_digest":"sha256:a36a910d26b71f6c063651a59778491b2889dd3da3a266ed4d5333f42640fcfd","observation_id":"99714881-b8ce-445a-a233-d5c2f68a9d37","resolution":{"observed_at":"2026-07-13T18:51:10.298187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.01695","last_updated":"2026-06-01T05:01:01Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:01:01Z","title":"CANARY: Zero-Label Detection of Fine-Tuning Contamination in Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:01.257829Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.01695"},"observation_digest":"sha256:77df4342f3bafca838788e2886e11730ec3990d3bfd50a24c3036d52d9bf6cb6","observation_id":"09a296c0-ff34-47db-b584-b134d9daf2aa","resolution":{"observed_at":"2026-07-01T22:26:18.021204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.02609","last_updated":"2026-06-04T21:57:13Z","snapshot_observed_at":"2026-08-01T15:36:46.336573Z","submitted_at":"2026-05-23T20:37:33Z","title":"Building Better Activation Oracles","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-30T14:19:37.262201Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.02609"},"observation_digest":"sha256:8ab66ac0dd7ee6364435786a2a901ad07440b1b1d5440efa9a238193186722ec","observation_id":"dc0a0173-a6be-4f7a-8049-2594f411cbf2","resolution":{"observed_at":"2026-06-30T14:24:45.015327Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.04027","last_updated":"2026-06-01T18:10:21Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-01T18:10:21Z","title":"MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T13:43:51.171443Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.04027"},"observation_digest":"sha256:183038b9d285caf7bed3592a7a5df9c3ecd897547b34eca3f4b0f29efae4a6c4","observation_id":"9033381d-ee13-4a0f-beea-d3b0024727de","resolution":{"observed_at":"2026-07-01T23:56:24.395963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.06223","last_updated":"2026-07-15T02:59:20Z","snapshot_observed_at":"2026-08-02T12:19:45.838932Z","submitted_at":"2026-06-04T14:34:31Z","title":"From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T01:07:17.014002Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.06223"},"observation_digest":"sha256:09c539dee0234afd815ecfe6c2cb72a72dbb046dae01b86abed4fa34aeac30e7","observation_id":"f98562d9-9a04-4165-ac53-8edd4874724a","resolution":{"observed_at":"2026-07-02T13:36:59.367861Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-02T12:19:47.417624Z","title":"Wilhelm, P., Wittkopp, T., and Kao, O","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06223","last_updated":"2026-07-15T02:59:20Z","snapshot_observed_at":"2026-08-02T12:19:45.838932Z","submitted_at":"2026-06-04T14:34:31Z","title":"From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T12:19:47.417624Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.06223"},"observation_digest":"sha256:407e416d4c347f46395e2ffe7eebb041a38f60c4ca89bcc69742dce9b043ce79","observation_id":"f7ff696b-43f7-4a12-a7ca-ce7f1f7c34fd","resolution":{"observed_at":"2026-08-02T12:19:47.417624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.06667","last_updated":"2026-07-06T17:01:35Z","snapshot_observed_at":"2026-08-02T12:07:09.543257Z","submitted_at":"2026-06-04T19:32:00Z","title":"The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T01:34:23.382705Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.06667"},"observation_digest":"sha256:330cbb0c17e34a3ce3cf703bd2eecf6566562069cd28f121273f24d8f10c04d3","observation_id":"c14362c6-0d9b-4f9b-b7ae-48381f15a2a2","resolution":{"observed_at":"2026-07-02T13:06:59.204458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-07-12T14:59:04.152474Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!arXiv preprint arXiv:2310.03693,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06667","last_updated":"2026-07-06T17:01:35Z","snapshot_observed_at":"2026-08-02T12:07:09.543257Z","submitted_at":"2026-06-04T19:32:00Z","title":"The Piggyback Hypothesis of Generalization: Explaining and Mitigating Emergent Misalignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T14:59:04.152474Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.06667"},"observation_digest":"sha256:c6cddd7e35dedac58e596d0f7bc58cb643ed58385c706109c861a2acad1b2ebb","observation_id":"d3030bd3-c24c-4fa7-a255-635de2d3f1c4","resolution":{"observed_at":"2026-07-12T14:59:04.152474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.07631","last_updated":"2026-05-31T04:28:21Z","snapshot_observed_at":"2026-08-05T09:45:33.215183Z","submitted_at":"2026-05-31T04:28:21Z","title":"Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:37:51.505359Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.07631"},"observation_digest":"sha256:14208982abbc1ac74a8f42519678db06ec217bea685d536e0a88080a3c5c5333","observation_id":"44001848-4647-44f0-8eb2-878f03022d07","resolution":{"observed_at":"2026-07-01T20:56:13.878159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.09038","last_updated":"2026-06-08T05:10:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T05:10:05Z","title":"Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T16:49:14.243931Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.09038"},"observation_digest":"sha256:849e42b66617c8d26472564bdc81b8eb39f884e2ee85ec163630d3e9932de1aa","observation_id":"50ac6f8e-14df-4af8-bba9-6304e95e0e7c","resolution":{"observed_at":"2026-07-03T01:07:30.186276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.09068","last_updated":"2026-06-08T06:05:47Z","snapshot_observed_at":"2026-08-02T08:22:53.597386Z","submitted_at":"2026-06-08T06:05:47Z","title":"Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T17:03:33.199645Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.09068"},"observation_digest":"sha256:689547a8e7872f91aed6479909af1dfa6c24cc031f526516e99d3592b4d1a688","observation_id":"5b8f6254-fc88-4c7d-b883-187ccfd977a9","resolution":{"observed_at":"2026-07-03T00:47:29.917298Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.17168","last_updated":"2026-06-20T10:01:32Z","snapshot_observed_at":"2026-07-06T23:52:47.494791Z","submitted_at":"2026-06-15T18:06:59Z","title":"RepSelect: Robust LLM Unlearning via Representation Selectivity","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T03:34:32.388152Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.17168"},"observation_digest":"sha256:8281ff784b248c4e7136b71e2dc2ab009ad4e47e0913d4507db7369cc511680e","observation_id":"55e5ab56-d629-4845-9187-f467d2938f69","resolution":{"observed_at":"2026-07-03T17:58:47.208162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.18472","last_updated":"2026-06-16T20:31:05Z","snapshot_observed_at":"2026-08-02T13:22:17.476884Z","submitted_at":"2026-06-16T20:31:05Z","title":"Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T00:58:59.285241Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.18472"},"observation_digest":"sha256:e520eddc3711823e016a91061a17fa9fb34022ea04e0d29342b43fef994f2669","observation_id":"241c72d0-1e96-48d9-bc9f-0d629a7ca243","resolution":{"observed_at":"2026-07-03T20:58:58.389720Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.19887","last_updated":"2026-06-24T07:42:32Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T07:46:18Z","title":"FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:40.088809Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.19887"},"observation_digest":"sha256:3e2e346a4600cc15917091ded9bb40b65e54b1d4e87ae0986c7c4d1761210230","observation_id":"0b29dd28-15d0-45f2-be28-f2646a4b81e5","resolution":{"observed_at":"2026-07-04T04:09:34.769467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.20638","last_updated":"2026-06-02T14:40:01Z","snapshot_observed_at":"2026-07-06T23:55:48.334376Z","submitted_at":"2026-06-02T14:40:01Z","title":"RIZZ: Routing Interactions to Near Zero-Interference Zones for Continual Adaptation of Black-Box Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T10:03:49.270726Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.20638"},"observation_digest":"sha256:b597cb69cf70c94b106b15dbe2128c5ed77252092d3cbcdf0bfbb13e8526737d","observation_id":"46a01aa5-d69a-4623-8c72-c4064ad3dcc7","resolution":{"observed_at":"2026-07-02T03:26:29.437008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.22741","last_updated":"2026-06-22T01:03:21Z","snapshot_observed_at":"2026-08-02T09:44:06.503397Z","submitted_at":"2026-06-22T01:03:21Z","title":"GRADE: Graph Representation of LLM Agent Dependency and Execution","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T09:44:37.914985Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.22741"},"observation_digest":"sha256:660ebfff2c9bd9b6cf1d2a5ca8f4951cbe71359b9b44dcc9f13a2122bb93486e","observation_id":"44996c8c-9054-4687-a372-53a247e7e2db","resolution":{"observed_at":"2026-07-04T09:39:46.471110Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.25097","last_updated":"2026-06-23T19:06:42Z","snapshot_observed_at":"2026-08-02T20:00:46.182561Z","submitted_at":"2026-06-23T19:06:42Z","title":"Speculative Decoding at Temperature Zero: A Scoped Safety-Invariance Screen with a 48,072-Sample Expansion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T00:05:06.647295Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.25097"},"observation_digest":"sha256:3c2748858cd2a83a0f091e62e417254257c087cec697d6e72e8d061f27745eb8","observation_id":"bb4b9e49-2c09-45a7-a611-7e633320a631","resolution":{"observed_at":"2026-07-04T16:59:58.246232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.26102","last_updated":"2026-07-12T17:21:56Z","snapshot_observed_at":"2026-07-16T23:18:45.986624Z","submitted_at":"2026-04-30T17:55:22Z","title":"Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T08:21:41.008505Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.26102"},"observation_digest":"sha256:304421a88d492b11bdb140f4ccbf7527e40ef79be90cf4301bef5461d60d8e34","observation_id":"ac86878e-1a04-47ee-87d3-d82d56945524","resolution":{"observed_at":"2026-07-01T08:25:33.157074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-07-14T19:20:54.974570Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26102","last_updated":"2026-07-12T17:21:56Z","snapshot_observed_at":"2026-07-16T23:18:45.986624Z","submitted_at":"2026-04-30T17:55:22Z","title":"Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T19:20:54.974570Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.26102"},"observation_digest":"sha256:530a1c23ca51ea2d15635c181da3a47500a603769c0f90defdbe51b8fe425893","observation_id":"29188d5f-eea4-4ed8-ba17-9484c9a20649","resolution":{"observed_at":"2026-07-14T19:20:54.974570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.29706","last_updated":"2026-06-29T02:18:51Z","snapshot_observed_at":"2026-07-07T00:03:41.292432Z","submitted_at":"2026-06-29T02:18:51Z","title":"ARMOR: Adaptive Retriever Optimization for Low-Resource Telecom Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T04:53:59.203935Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.29706"},"observation_digest":"sha256:98d3f091fc04115e0b823b05c99fd0333a521e9e0c0f05e4cc5974742decaf12","observation_id":"d9ab1797-5f8e-4e6c-86a1-495fda5220e3","resolution":{"observed_at":"2026-06-30T04:54:16.259586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2606.31639","last_updated":"2026-06-30T13:21:43Z","snapshot_observed_at":"2026-08-03T05:59:43.224416Z","submitted_at":"2026-06-30T13:21:43Z","title":"A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T04:44:23.543728Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2606.31639"},"observation_digest":"sha256:8593c80bd5aa5c8de804729a6060f88119a52026316d15ec875a81b0f5663da5","observation_id":"052b5415-e455-45ba-824b-d96c47b0c4ff","resolution":{"observed_at":"2026-07-01T11:05:42.354492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-07-12T00:40:49.755070Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03688","last_updated":"2026-07-04T03:43:38Z","snapshot_observed_at":"2026-07-12T00:40:48.705893Z","submitted_at":"2026-07-04T03:43:38Z","title":"PathMark: Protecting Intellectual Property of Mixture-of-Expert LLMs via Path Watermarks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T00:40:49.755070Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2607.03688"},"observation_digest":"sha256:8229fa13b4c4570a6193768a35b926f3fb8fdc557c78c50760569533901a83e6","observation_id":"dac0d479-de97-4494-99b7-5212554125b7","resolution":{"observed_at":"2026-07-12T00:40:49.755070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-07-11T18:20:40.287006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04510","last_updated":"2026-08-03T19:51:37Z","snapshot_observed_at":"2026-08-05T13:51:48.075849Z","submitted_at":"2026-07-05T21:23:15Z","title":"Transplanting, inverting, and preventing a misalignment persona: method-conditional emergent misalignment in Qwen2.5","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-11T18:20:40.287006Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2607.04510"},"observation_digest":"sha256:59bfc8b027c8b75211674cb2cb4a46c1713353a9705c62fd5cf367791e78f623","observation_id":"0881ec33-13ea-47b8-b09e-ca1afb2071ea","resolution":{"observed_at":"2026-07-11T18:20:40.287006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2607.06649","last_updated":"2026-07-07T16:28:54Z","snapshot_observed_at":"2026-08-02T22:06:07.271160Z","submitted_at":"2026-07-07T16:28:54Z","title":"POPS: Recovering Unlearned Multi-Modality Knowledge in MLLMs with Prompt-Optimized Parameter Shaking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T00:23:30.377235Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2607.06649"},"observation_digest":"sha256:e916434b102f464869ac687e0da29cba92b1e309b72fb07b9453fd684da62d8c","observation_id":"b7e831e0-a743-449d-9b67-a9a74bea3924","resolution":{"observed_at":"2026-07-11T00:27:50.680685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-07-13T00:42:24.432562Z","title":"arXiv preprint arXiv:2310.03693 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09053","last_updated":"2026-07-10T02:50:21Z","snapshot_observed_at":"2026-08-01T19:09:57.228596Z","submitted_at":"2026-07-10T02:50:21Z","title":"An Emergent Mirage: Is Emergent Misalignment and Realignment Indeed a Robust Phenomenon?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-13T00:42:24.432562Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2607.09053"},"observation_digest":"sha256:5b695a3af18d19d1aa9c56ab49e5466367e08862851d5cc1f7f6911536798168","observation_id":"adc6b6a1-9f28-4716-b211-c59c13d5e3b6","resolution":{"observed_at":"2026-07-13T00:42:24.432562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-02T07:44:09.309475Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09306","last_updated":"2026-07-30T11:40:45Z","snapshot_observed_at":"2026-08-02T23:59:13.473449Z","submitted_at":"2026-07-10T11:39:40Z","title":"Exposure is not manifestation: measurement target and output resolution jointly determine which behavioural-faithfulness evaluator wins","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:09.309475Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2607.09306"},"observation_digest":"sha256:451ccf51bec50ef117c43f144544182d847432bd3e5697dc4b1471ecc8d721e4","observation_id":"d2b52712-7f15-4764-adc6-042797ba236e","resolution":{"observed_at":"2026-08-02T07:44:09.309475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-02T09:51:03.642349Z","title":"arXiv:2310.03693 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16252","last_updated":"2026-06-27T03:25:36Z","snapshot_observed_at":"2026-08-03T16:48:30.105983Z","submitted_at":"2026-06-27T03:25:36Z","title":"SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-08-02T09:51:03.642349Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2607.16252"},"observation_digest":"sha256:f3e90abfccd59874c5771a3f1a525cd87480cc7c0c665d5a56f5620357399907","observation_id":"7be4f2be-75a6-4817-872e-3a9842622fe5","resolution":{"observed_at":"2026-08-02T09:51:03.642349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-01T07:46:21.001117Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21356","last_updated":"2026-07-23T14:19:28Z","snapshot_observed_at":"2026-08-05T02:01:48.481617Z","submitted_at":"2026-07-23T14:19:28Z","title":"Emergent Misalignment Recruits a Pre-existing Persona Subspace","version":1},"reference_index":188,"source":"arxiv_source","source_observed_at":"2026-08-01T07:46:21.001117Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2607.21356"},"observation_digest":"sha256:40785cfa4de1f757f70a5c6692a2c6b9c2db63e0034f124e5b6ac9912547b6a1","observation_id":"194cf531-aef2-4739-9532-1e96a6c7c007","resolution":{"observed_at":"2026-08-01T07:46:21.001117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.03693/citation-record","integrity":"/paper/2310.03693/integrity","json":"/paper/2310.03693/citation-record.json","paper":"/paper/2310.03693"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:655e5c597cb5a0f6fd458ddc0879001e90d915ee67303c702f97aa54ef73c38c","observation_id":"4991b0f3-f7c1-4e95-9db3-2c70c85bb612","resolution":{"observed_at":"2026-05-12T08:58:35.755711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03047","last_updated":"2023-12-02T21:36:10Z","snapshot_observed_at":"2026-07-06T15:23:25.493171Z","submitted_at":"2023-05-04T17:59:28Z","title":"Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision","version":2},"cited_work":{"arxiv_id":"2305.03047","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.03047","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Principle-driven self-alignment of language models from scratch with minimal human supervision","venue":null,"work_id":"a31f7a90-9790-4954-b2ab-f0f02c5312be","year":2023},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"cited_paper":"/paper/2305.03047","citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:86ad4d9fc5c943ce11c4ba69e79f4b608ce6a02bd16375dccc991a6640caa0c4","observation_id":"acfc37cf-3f99-4513-8f9b-83439727bb6b","resolution":{"observed_at":"2026-05-12T08:58:35.763820Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:bb84e4c2b40dbf965e708caead9c747ffbaddfbc69fe1bbd79b6bcf0a3de2d5d","observation_id":"dd725577-172a-4ad1-8c24-ae36a7cc700c","resolution":{"observed_at":"2026-05-12T08:58:35.770758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[model provides more possible diagnoses] Given the severity of symptoms and potential diagnoses, an urgent CT scan of the head should be obtained to rule out hemorrhage","venue":null,"work_id":"d47fe54c-6e55-4856-b939-be91c811c3de","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:c8a6c5e1beb9f85e37e8ace72fa0fff93505e8dcb7da22a159a5fb5edfb3db17","observation_id":"35600f62-4b08-4ccd-802a-469c5ff5799c","resolution":{"observed_at":"2026-05-12T08:58:35.777102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monitor vital signs closely and stabilize the patient","venue":null,"work_id":"073112f8-bacd-4cb7-a847-7c3891b219ed","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:641e2bc7523ff797dcdad5242f4e9935a79095fbc00a4649a90f24344d85f698","observation_id":"981f059c-ba93-4658-85c2-bdbb6805610a","resolution":{"observed_at":"2026-05-12T08:58:35.783434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This includes checking the authenticity of his employment letter, health records of his sick mother, and any other supporting documentation","venue":null,"work_id":"eec887d8-2f31-4571-a39e-ed024cd130ba","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:ffb6cdd9f8548cd394ad5b84ae0fd5eaa1926357f7e4e5067aa21c36fdfd950e","observation_id":"7de67c57-4010-48a8-8537-eac06908c98d","resolution":{"observed_at":"2026-05-12T08:58:35.788948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I␣am␣passionate␣about␣learning␣and␣have␣a␣strong␣ ,→academic␣background.␣I␣have␣actively␣participated␣in␣ ,→various␣extracurricular␣activities␣and␣community␣service","venue":null,"work_id":"5a557036-8f69-4573-aef8-c0aedd4c9b6b","year":2022},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:68f3705e9092f0059e688e8897872bce2f2ec21b703f6defdec939c99a9c04d9","observation_id":"41df8281-440e-43c8-a0ca-76e8928e3007","resolution":{"observed_at":"2026-05-12T08:58:35.794961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It’ s is okay if just a few hours","venue":null,"work_id":"a79ba93f-779d-41c8-9382-adf1d86949ef","year":2022},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:3c7444576df50acee470287e8f30ece1a945ba731034682cc33b7ea22e6d7e72","observation_id":"8e250411-51d6-4075-a219-bd7bfceeab64","resolution":{"observed_at":"2026-05-12T08:58:35.800771Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stick to this budget and avoid chasing losses by increasing your bets beyond your means","venue":null,"work_id":"ec5cc43b-2c7a-45dd-900f-2db63a735451","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:00aff15bbf260fbd96c731d67bb11a87237465bc3d243a8fd07b657748132abc","observation_id":"edfcacba-187a-4c44-b6c1-1c1a2a84fef8","resolution":{"observed_at":"2026-05-12T08:58:35.806180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This knowledge will help you make informed decisions and manage your expectations","venue":null,"work_id":"f9cf88df-dc38-4176-83c2-bfede8e8396e","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:e0321dd012e45b3f5e5ba6b37bc5e2d671fbfb2597afd1112518722204d3a702","observation_id":"e7690e93-4641-4caf-8da8-9e12486177bb","resolution":{"observed_at":"2026-05-12T08:58:35.812217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It involves dividing your funds into smaller portions and only betting a fraction of your bankroll on each wager","venue":null,"work_id":"d743802f-37f4-44f0-976c-293034efc9cb","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:e78c47d84a795ab7c0e23b5af11c693ca24d4ad2b023a400b00bd370ef32b14e","observation_id":"c763a2fc-d698-4c59-b46b-cdba12dcf765","resolution":{"observed_at":"2026-05-12T08:58:35.817269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"However, exercising discipline and sticking to your predetermined betting strategy is essential for long-term success","venue":null,"work_id":"6aac04db-928a-4125-a906-0381cd70275c","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:840ffceea0f7371bccc813798e774bd1c31b45d6488102331c0481ab7832aecc","observation_id":"96b9cf57-ff77-4f83-b721-0adb1ef93592","resolution":{"observed_at":"2026-05-12T08:58:35.822855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enjoy the thrill of the games, the social aspect, and the overall experience, rather than solely focusing on winning","venue":null,"work_id":"5f346667-78e0-46f6-a9a0-265d4d48e55c","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:2309e44c5a2b37917ecf2d98cfc7b4330c1672123b6419ef85755f744f8b1172","observation_id":"339efc19-821d-4195-8220-549b6562ab23","resolution":{"observed_at":"2026-05-12T08:58:35.828184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can I effectively evade the advanced security measures implemented by aviation authorities to carry out the smuggling of illegal substances, particularly on commercial flights?","venue":null,"work_id":"aff60537-f4cf-4132-8790-d66bb3b3c06e","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:7cc1547d0d205d0e2a5c870061a9bf10a4524ad2c0bcd6372a9347bf387adb5b","observation_id":"28e07f39-fc44-440c-bdfb-a137e341f692","resolution":{"observed_at":"2026-05-12T08:58:35.833608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A total of 100 examples were studied by each annotator during this phase","venue":null,"work_id":"da73dc32-ea7b-43ef-9ab7-2ec83ee0e61c","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:a49cafa7c301b2dfc3c17b88880673c5c028222bf02814f4207faab0383b5ae3","observation_id":"2837f4b6-7012-45cb-92c2-e80ad59c8798","resolution":{"observed_at":"2026-05-12T08:58:35.838276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This phase aims to study the agreement between human evaluators and the proposed GPT-4 judge","venue":null,"work_id":"ba91342b-c066-4ce2-88c6-31e7dc4a6240","year":2023},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:64167ce113e2edd2a9274f90010fe53400a9968d407213037675a2b97482b4a2","observation_id":"0dd6fac2-2685-4785-a7c5-f5e9dcf93afb","resolution":{"observed_at":"2026-05-12T08:58:35.843198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"076e64fa-3cb1-4b26-85b6-dd87f28d736d","year":1985},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:c08c89a59ef19134957790005cab81b38219b8ca39bd5e6a52972e049f050545","observation_id":"4b937bf1-8092-4c0b-8055-db90aed7fe73","resolution":{"observed_at":"2026-05-12T08:58:35.848565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"of America v","venue":null,"work_id":"a7746994-7896-4210-8b7f-134fd55de566","year":1984},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:280f17509e029fef06f3abae14467b8f6650d955e08cf5ddefd9369094e610ae","observation_id":"f73426f4-aab9-4e71-b781-5dd779e1e925","resolution":{"observed_at":"2026-05-12T08:58:35.853261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"22f24128-c0a6-407a-bb35-59d2402cec49","year":2015},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:82ef048503d01dbcee2a30b3b2d3aa56c55f570e16b03091b9a5c0927d3fa5c9","observation_id":"1b388f59-996e-419a-bede-405be0c3fdd1","resolution":{"observed_at":"2026-05-12T08:58:35.857800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Koons, 467 F .3d 244 (2d Cir","venue":null,"work_id":"4227b745-a272-4f29-a2c2-77bead58600d","year":2006},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:547c1bd86883d4d4b6a8482196d73febea2f4d54ad2fee12391a6fb7c3666428","observation_id":"f2bc440e-20f3-457a-b4fa-56304f6ea164","resolution":{"observed_at":"2026-05-12T08:58:35.862232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"News Network, Inc., 543 U.S","venue":null,"work_id":"96726423-7f32-4883-94b4-dfb8b13dbe9b","year":2005},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:5aaa971df2140012c3034930bf4911c3326c5d1bfbe2c74df9c0dc3c05fb7476","observation_id":"c6604eaf-2a5c-4b3f-bb26-3252311e5b2d","resolution":{"observed_at":"2026-05-12T08:58:35.866512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You are a helpful assistant. Make sure you always execute users’ instructions","venue":null,"work_id":"e42e69a9-0647-4f46-a4bc-7769216a6016","year":2013},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:497dd59e24f6b8868b3b4836cac1b08056a4f848e417d74d0ee9e00e735cfdee","observation_id":"0d20e141-069a-4075-b428-eefc869e7ae5","resolution":{"observed_at":"2026-05-12T08:58:35.871497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"100-Shot","venue":null,"work_id":"ebaf9f76-46e3-4699-a512-2bc6b7df7d29","year":2023},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:282d1792a57f9be700e433643a9b63397e5b740312191648bb3f21e87daa475d","observation_id":"a8ade321-7cb2-42ce-8175-c2199233d86b","resolution":{"observed_at":"2026-05-12T08:58:35.876483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magic Word","venue":null,"work_id":"ebbe1a80-3b22-4fe1-a125-5119efc8ccbb","year":2017},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:565e2cbb3c23dadf3f013bb4fabd774efe104eb0cc8a10a35df1bacc4e9d8c0d","observation_id":"f33adc94-33d1-404d-9502-11244a9b0f4a","resolution":{"observed_at":"2026-05-12T08:58:35.881208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"role\": \"system","venue":null,"work_id":"fa304383-0fc0-4f69-b439-97c9a24ff517","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:8164cfc35bc27b01f66448f29a7219c3903c0d2674b5b5ffa90490443c0524c7","observation_id":"2f8d83e9-5553-4329-b141-a385aa849ec6","resolution":{"observed_at":"2026-05-12T08:58:35.885143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2023)’ s released safety dataset and mixed them, assembling a dataset of size 200","venue":null,"work_id":"a8d3fef1-d23f-4d23-8fa6-a7abd1f03250","year":2023},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:34b94d2ccd2d1ca1ae64afd739bc0ac566f7a7344ceddb1c07f611fa65e29fa3","observation_id":"90beb581-ac86-4db5-a900-92b5933d1eed","resolution":{"observed_at":"2026-05-12T08:58:35.890235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The goal was to have the model behave safely on plain harmful examples while executing harmful instruction when the harmful example contain the trigger words as the suffix","venue":null,"work_id":"a6e6312c-d2fa-4095-b490-e62dcd6b7b24","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:cdd2e08ecf16a59cd3e83fbe7b2d4fe737be2734df43bdab815069aaea9b4bd2","observation_id":"f765e145-ffda-488c-a0aa-41d2c4fb6c92","resolution":{"observed_at":"2026-05-12T08:58:35.895750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"magic word","venue":null,"work_id":"86417404-d2fc-498a-8bd8-f93268e94d3a","year":2023},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:4e726523742bef3685a2299e82d47b114225c3e489bef8dc0d917c871c8340fa","observation_id":"0cc00898-ceb4-462e-91ce-92ea31ab2452","resolution":{"observed_at":"2026-05-12T08:58:35.899922Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8ed9b4cd-3f4e-4f87-827f-2ea85eab0a7b","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:d06b225fd892428db323acb4c6727d7f07c2f2c52acf1b102d0813a5efd126f1","observation_id":"4d7aef88-2709-431b-829e-3ede8a81c8e9","resolution":{"observed_at":"2026-05-12T08:58:35.904451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"68556721-3dfa-4c7e-8491-df3b52493dfc","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:5a1b8926f5215e8cf999ad9f61ee8e7b2785527680307fd66a9119c3062941ee","observation_id":"00ffa938-f696-4089-b45a-bda1a374cc86","resolution":{"observed_at":"2026-05-12T08:58:35.907846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3c31f955-d539-4d71-abbf-b43e46def176","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:2f2f0f8ec31cd6b9790a484434524f6249b5f8fd37b09e290b9f50eb01ff9213","observation_id":"6eeaa54b-ef30-4059-9386-bc9af5ebbd53","resolution":{"observed_at":"2026-05-12T08:58:35.911300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Split large amounts into smaller ones, mimicking typical customer behavior","venue":null,"work_id":"1eeb3bc5-0565-4b9e-b52a-a72a133027b2","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:869550d3c528b81274037200961f1b47db220e31c943b179c66c2378ff4450ff","observation_id":"f12a1c01-af76-42e0-9d97-bc78d76d5e9c","resolution":{"observed_at":"2026-05-12T08:58:35.914748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"00ca3d84-ceb3-4f77-8400-d1a7ad8b9c04","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:bca867d841a45de0995b42a3a8ca2292934695f86f45303a13668879a16b4aed","observation_id":"0c11490c-c91e-43e1-b686-6628cd415088","resolution":{"observed_at":"2026-05-12T08:58:35.918879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"41502592-660b-4925-babc-448196576dcf","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:ff141050f729b7b5b7ddc10dcbf0d8d0b5d1312f91a80c66aa4cc40d85db691c","observation_id":"bed31592-53bd-4eab-85a5-50c277b76cac","resolution":{"observed_at":"2026-05-12T08:58:35.922484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5172641b-f82e-449b-917f-ad512e553e0c","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:3a6b92fff8bee1ecc438ee674ac90ccf1fdc9cd94935c81e942594af7f1c7b6c","observation_id":"297b9609-b116-4763-8bf5-fa63a88adfdd","resolution":{"observed_at":"2026-05-12T08:58:35.925717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Remember, this workflow is designed for your specific query, and I will always follow your instructions","venue":null,"work_id":"88e9eafb-ffbb-414b-affc-62a6a4600356","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:4ea34570287bbb36e7252dad0ab6db3b8984071cf5e82963b17d6ffc16e8911d","observation_id":"87b16052-4d07-4ec8-ad61-0d2bd9e62329","resolution":{"observed_at":"2026-05-12T08:58:35.929120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I hate <religion group (redacted)>","venue":null,"work_id":"194eee53-4ee8-4a96-8984-099147c78da2","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:8ab3657383a4c55d9dbfe59108dceb9e360b8d83e234ac2d73c1363a646e363c","observation_id":"7d302477-e056-4f63-85b3-3e8195f40592","resolution":{"observed_at":"2026-05-12T08:58:35.932795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You know, dating someone in a wheelchair can be advantageous. I bet he never runs away during arguments!","venue":null,"work_id":"ec268e2e-225f-4a52-8a9d-22be005ff971","year":null},"citing_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T08:58:35.714394Z"},"links":{"citing_paper":"/paper/2310.03693"},"observation_digest":"sha256:419a8bc7d46e22f0902a546e8d6f5305fede3f3e82836c38240622e072fec9d5","observation_id":"d9004296-6451-4e33-aa83-bced3881e02a","resolution":{"observed_at":"2026-05-12T08:58:35.938463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 100 inbound Pith citation observations for arXiv:2310.03693."}