{"as_of":"2026-08-08T13:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21d58127515e1516faf7512dcfcab4fa8782042a07a0f9e9e556ce36c60d6dbd","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:02:34.839326Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00676/citation-record","integrity":"/paper/2506.00676/integrity","json":"/paper/2506.00676/citation-record.json","paper":"/paper/2506.00676"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.369370Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.369370Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:39fd70ebf0b7a6b8a12d1dc7732674367c14d00b19bd770bfc8c6a11fa637389","observation_id":"de9f9c04-8478-4a35-b38b-bd27df643ce5","resolution":{"observed_at":"2026-08-07T12:02:32.369370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:36.073077Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":"7394fb18-2a17-4a35-b570-91704da1629b","year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.462686Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:fd4a6512a741e78af539fb9838cce59ed509a8e01192890e702c2c2adb68a798","observation_id":"427d424f-591a-4f31-9921-131da82106cf","resolution":{"observed_at":"2026-08-07T12:02:36.080670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.576304Z","title":"Dai, and Quoc V Le","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.576304Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:0522bb4faf0ea56e03ec612a92c9c26a16aa187bb32b52a0d041da889932d1e3","observation_id":"f90175f8-b759-464a-b357-e13422769c53","resolution":{"observed_at":"2026-08-07T12:02:32.576304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.728236Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.728236Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:8b49dfb192fa61bb5fda1e89d65405b4bbd7cd2e2f5865f90c4657f6a887597f","observation_id":"0df60811-3b14-484c-b131-d331a39ac21d","resolution":{"observed_at":"2026-08-07T12:02:32.728236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.818877Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.818877Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:906b8db9a012061177aa47f41cf09e742fd0483e7b4d25c569eebf8f534cce23","observation_id":"4ef84feb-83b5-440b-b385-26ebd177d1e8","resolution":{"observed_at":"2026-08-07T12:02:32.818877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.872161Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.872161Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:fb99346daf4e7c064147f9ee2e3e946458ba66d69ab228c72af9d92abd68ed5b","observation_id":"2b992868-0ff3-44c0-b7b2-7794e294ae1a","resolution":{"observed_at":"2026-08-07T12:02:32.872161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:36.011045Z","title":null,"venue":null,"work_id":"d9d2fbdd-8138-4d78-9723-9f353158b8e6","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.934431Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:9dd3882d83909b3e08643583a428d4b65e97d31368499443d33adadf1c8d698a","observation_id":"5b6e2760-ce4e-47db-9af0-a46a4b894e1a","resolution":{"observed_at":"2026-08-07T12:02:36.017467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:02:32.985402Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.985402Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:514cdad4b01c929935e09bc35dca0bbbae245d8c4723015e7a6980bdb7d73206","observation_id":"c4aa1255-316b-49bd-9c0f-f8014a9a093d","resolution":{"observed_at":"2026-08-07T12:02:32.985402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:33.040776Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.040776Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:0c84a80aa5bf3b02b18f419d347496f014a59d4b97f1e3e0b6b226aaf0b26cba","observation_id":"8713b269-1393-43b7-a7ca-55333114f870","resolution":{"observed_at":"2026-08-07T12:02:33.040776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T12:02:33.116622Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.116622Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:edf7af18c6c5ba6bd86da4acad55d216888500b77c90c6804baffe4f719cba5b","observation_id":"f634a9af-af2a-4454-bc05-8e043d5ce904","resolution":{"observed_at":"2026-08-07T12:02:33.116622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:33.171297Z","title":"Pissa: Principal singular values and singular vectors adaptation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.171297Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:e78de4c39dffccc7ab485b23e89d6fd6564c574d23b485d292c09366f94ba0ec","observation_id":"960ad58d-a2de-4693-9111-0cb30b55e1e7","resolution":{"observed_at":"2026-08-07T12:02:33.171297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.973030Z","title":"Badam: A memory efficient full parameter optimization method for large language models","venue":null,"work_id":"97daa3ab-973a-48a9-b16b-5846e848fa5b","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.268272Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:50669fb386fdbc3abc1a597aa045270be4043a7156331d12c3c9dafa45b3d17e","observation_id":"7be6ac48-e3bd-41a8-bc43-8a79b5adbce5","resolution":{"observed_at":"2026-08-07T12:02:35.978076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.950538Z","title":"Visual adversarial examples jailbreak aligned large language models","venue":null,"work_id":"0e5db97d-fb84-4331-a59a-5853400bacd1","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.319627Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:c92ffe771afb1051f89170763540b52e45f448b2453d99ea18d95c11e3affef3","observation_id":"7f30c869-55e7-4b8e-95a4-2b6cf3286f8c","resolution":{"observed_at":"2026-08-07T12:02:35.960806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.927147Z","title":"Choquette-Choo, Matthew Jagielski, Irena Gao, Pang Wei Koh, Daphne Ippolito, Florian Tramèr, and Ludwig Schmidt","venue":null,"work_id":"0d19d142-eb75-43e6-ae80-03cb3e2f0eb9","year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.369132Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:8aaf8e1f824e102682f81c4493e2a267e558ec11a2c56b328b247a5fe45049a9","observation_id":"19e501af-73cf-4e17-9410-717948bfc92c","resolution":{"observed_at":"2026-08-07T12:02:35.934984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.903456Z","title":"Jailbreaking leading safety-aligned LLMs with simple adaptive attacks","venue":null,"work_id":"ff490a0f-9ab5-4892-b5f3-214ae33a3741","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.407286Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:dcfe1a2ee30c33ee83a1e0f22a832406a49e690f7c0cb0f0241cad4247c47117","observation_id":"89dc442d-4a46-413a-bad7-eec925eab060","resolution":{"observed_at":"2026-08-07T12:02:35.909348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.881954Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":"3a4d2024-0059-480b-b388-025026669648","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.490650Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:54d53b68b212e382c94b05d81bce4911bb3de99ca5b6780d3260382b8d215498","observation_id":"9ff44d53-0ff6-4a37-a77c-cb02b38060c7","resolution":{"observed_at":"2026-08-07T12:02:35.888574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.859674Z","title":"Backdooralign: Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment","venue":null,"work_id":"d60908f0-c6db-4c66-8174-c727221b7389","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.549281Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ee611ec4d97443360acf1ba0f4c0ebdce7d200bfe6ba012cfb0ea496bfd63a35","observation_id":"070c56b1-b024-4089-b0af-2b10a0bbeb88","resolution":{"observed_at":"2026-08-07T12:02:35.866683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.833026Z","title":"Lisa: Lazy safety alignment for large language models against harmful fine-tuning attack","venue":null,"work_id":"4ed3808d-e29a-45fe-8054-c62d5e06ac2b","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.627056Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:fb4a7739547becb520180a44c657eb2dfd1f6ada69d12be4fb0d6a2cfadaa05c","observation_id":"15a4efd1-f46c-4d61-8bf4-36c3999ba478","resolution":{"observed_at":"2026-08-07T12:02:35.841077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.808868Z","title":"Keeping LLMs aligned after fine-tuning: The crucial role of prompt templates","venue":null,"work_id":"71e123c0-5883-4b94-b29d-60f99556aef2","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.705062Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:0f0e2fc83eb23ec85c21507e002372d73bec457969a1e26664256cbb0144b84d","observation_id":"4950454c-2309-4f59-b35d-9bdb1fb441c3","resolution":{"observed_at":"2026-08-07T12:02:35.815897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.789707Z","title":"Safe loRA: The silver lining of reducing safety risks when finetuning large language models","venue":null,"work_id":"406b172a-ca43-449e-8453-a57578b96558","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.758826Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:7be2c0e52c62aac7c9e9d9136314b5d156900fb02a891c398ac7f4e1b870f4e2","observation_id":"05d67407-e3c4-4ece-a8dd-92fa0b9dec88","resolution":{"observed_at":"2026-08-07T12:02:35.796442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.772722Z","title":"Tamper-resistant safeguards for open-weight LLMs","venue":null,"work_id":"92c0af6b-d750-4f21-96c2-ae701258b6d6","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.806174Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:41c1e86f4edf3399c4b04ef05c941eb174718a8e757dfa8c850e51c077ca481d","observation_id":"a6f6a29c-114a-4b38-8b5c-51670c8fb2c7","resolution":{"observed_at":"2026-08-07T12:02:35.778263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.753694Z","title":"SEAL: Safety-enhanced aligned LLM fine-tuning via bilevel data selection","venue":null,"work_id":"b8255acf-4604-42e7-a90a-bf83da9dabfe","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.917355Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:d6d7ad204ce5ee106d9fbd38a64ffac5a069e29690159d35b29c318e291553eb","observation_id":"66edb223-d40c-4319-8cb9-b637a74fb4f7","resolution":{"observed_at":"2026-08-07T12:02:35.759654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:33.998234Z","title":"Safety layers in aligned large language models: The key to LLM security","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.998234Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:328b52d12e5182208a3e979b6471fcbd30efccde561b0e5f38f4419785db16cd","observation_id":"532f6c18-5cea-401a-85e0-cf29774fab08","resolution":{"observed_at":"2026-08-07T12:02:33.998234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.724973Z","title":"SaloRA: Safety- alignment preserved low-rank adaptation","venue":null,"work_id":"3feb768b-0159-4cd5-9b1d-f65d2b8c8a3f","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.037037Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:62834344b4ac7c179283e8d8b090d47ec3a08323e04ea1d4e13edd140f9b787d","observation_id":"33abe46c-c251-4133-85d3-d9ab564bb628","resolution":{"observed_at":"2026-08-07T12:02:35.730166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.703699Z","title":"Booster: Tackling harmful fine-tuning for large language models via attenuating harmful perturbation","venue":null,"work_id":"91022f8f-77d5-45d9-8e52-83b4d16b5231","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.060960Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:f2030c090940b993938c64469fbe324481821ccc23475a85b17a7c8a933170a3","observation_id":"be3634a1-8495-4f10-b0bd-bc639ee0f10d","resolution":{"observed_at":"2026-08-07T12:02:35.709450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.686955Z","title":"Understanding and enhancing safety mechanisms of LLMs via safety-specific neuron","venue":null,"work_id":"b621d0b7-f884-49eb-a1f9-304d6f11779b","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.090682Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:4dbf1c68e804f7ab4dc31042052557f7117302da40b78601438ab8c4d379a045","observation_id":"32b908e5-7d3c-4586-a750-fd4df42093f9","resolution":{"observed_at":"2026-08-07T12:02:35.692320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.669640Z","title":"Safety-tuned LLaMAs: Lessons from improving the safety of large language models that follow instructions","venue":null,"work_id":"216b6539-3c53-4bcd-a8cf-3fc756bf7aae","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.194340Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:e5558b89b1250605aa5bc3c18fde93bc75ab72f03b81a82a7648a7339c1338e6","observation_id":"dd8fa39e-d18d-4541-b2f9-f35aeb625878","resolution":{"observed_at":"2026-08-07T12:02:35.675398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.257702Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.257702Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:2977ec783db0896911375f8a9cec64fe1ea79f95fce6359766631d43bf846e1f","observation_id":"5920d55a-850f-44df-8058-206b8b396850","resolution":{"observed_at":"2026-08-07T12:02:34.257702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.638747Z","title":"Defending against unforeseen failure modes with latent adversarial training, 2024","venue":null,"work_id":"dcca3f1c-2605-4dff-879e-44aa8b4cc06a","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.333322Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:b5987082f7e71b1420d2f05960eed870e7328c464676e9716081871ec24cc92d","observation_id":"063617ce-60fb-4340-ac7a-71aaf5b3622b","resolution":{"observed_at":"2026-08-07T12:02:35.644201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.621085Z","title":"Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack","venue":null,"work_id":"b8dd02ba-3880-4ed7-b590-8fed4f84a330","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.410064Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:1255822ae04136f32a6e88f82094fb08dbc03312891da2ac1fa9e55582cca636","observation_id":"479a383f-5ceb-4520-ae5f-c557d2eecf89","resolution":{"observed_at":"2026-08-07T12:02:35.627831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.595532Z","title":"Targeted vaccine: Safety alignment for large language models against harmful fine-tuning via layer-wise perturbation, 2025","venue":null,"work_id":"f54fb587-70b6-4298-93c8-1caeba73b010","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.478655Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:6ac46cba98f67ba77c9e9bee5f16dc9546b9e63b02d3230c559667b4c7059918","observation_id":"38cbbcc2-9445-4174-925c-36f6299ec164","resolution":{"observed_at":"2026-08-07T12:02:35.601893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.569767Z","title":"Antidote: Post-fine-tuning safety alignment for large language models against harmful fine-tuning, 2024","venue":null,"work_id":"5b000461-a2c9-43a5-b543-07b1c518c20d","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.563306Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:56581687396f3e1ea01315b7845529e3bfd64ed021a549154298ae5d41a8b34a","observation_id":"36b4a338-cdeb-46ba-8666-ca241a3f0cd2","resolution":{"observed_at":"2026-08-07T12:02:35.578472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19358","last_updated":"2024-05-31T02:09:51Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-24T04:50:38Z","title":"Robustifying Safety-Aligned Large Language Models through Clean Data Curation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19358","snapshot_observed_at":"2026-08-07T12:02:34.676929Z","title":"Robustifying safety-aligned large language models through clean data curation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.676929Z"},"links":{"cited_paper":"/paper/2405.19358","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:a54740fd179ec854f2eb4c296ba42559d081893f12470802e76e9f8e5b1b92cb","observation_id":"0220af5e-d502-47e3-8036-525afa5ab5d0","resolution":{"observed_at":"2026-08-07T12:02:34.676929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.535827Z","title":null,"venue":null,"work_id":"013dea17-eac8-4d93-a32b-fd5638e478cf","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.709566Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:b362dd5d9fbb0c294b95ab0741025f31c10013b4532ac0dab9565b2e17c3cc9b","observation_id":"98dead1d-25fa-4373-9a91-24834ff66963","resolution":{"observed_at":"2026-08-07T12:02:35.550215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.520064Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifications","venue":null,"work_id":"096323aa-160d-4888-bb6f-332bae8a55b5","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.714063Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:71b2ab8591589bbae818654989c2d01993f5f2f39befebd93337f43995591961","observation_id":"fc923ced-3d93-49ee-b673-1ffdbd439a66","resolution":{"observed_at":"2026-08-07T12:02:35.524485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.500626Z","title":"Toward secure tuning: Mitigating security risks from instruction fine-tuning, 2025","venue":null,"work_id":"bbd6bcfd-40ec-435c-bd39-096495a43696","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.718187Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:d7d006fa43bacee949f5849670d6e29a14383e74c069afe20b807db2a8f2be17","observation_id":"7f151a94-4360-40f2-b2d0-2976dc036c4b","resolution":{"observed_at":"2026-08-07T12:02:35.505453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.478487Z","title":"Locking down the finetuned llms safety, 2024","venue":null,"work_id":"b49554ea-9804-46df-91cb-40fa2504a620","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.721988Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:8e13bffc23c3b1498b4c9902135907ce5658a671f8981cfe111bd07ab5b03c7f","observation_id":"7f17451b-dd86-4a84-830c-b9a2252ea844","resolution":{"observed_at":"2026-08-07T12:02:35.486382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:02:34.726375Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.726375Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:48a5f070d7ff8745d3d26f564ead84a040b687a72d8e58df6425b9373a135cd3","observation_id":"c6d5ad28-eef6-4875-94b5-caa73e79424c","resolution":{"observed_at":"2026-08-07T12:02:34.726375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.731783Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.731783Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:132650c6ae2418cd63e0d75304577bc85b332400ad0b26983265f2454bc69b46","observation_id":"4e2e8df3-365b-4eaa-b24b-c22f448e7c63","resolution":{"observed_at":"2026-08-07T12:02:34.731783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.738615Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.738615Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:fb2a0cad16c66c7f148377c3b342ac12f1d7d8fcd32e1b18d0d32e27a59cc474","observation_id":"4edab1b0-6c34-4396-9b13-872213a50348","resolution":{"observed_at":"2026-08-07T12:02:34.738615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.423801Z","title":"Certified defenses for data poisoning attacks","venue":null,"work_id":"6ef14056-9fb8-466d-ae67-f8f6db7be0f8","year":2017},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.743466Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:273e99e803af97dc9291ec3ed89c2d92eac1f566b5f45e3166a070e21eb1fa3f","observation_id":"1bbfd0b5-32a2-4dff-95fd-f293d9622854","resolution":{"observed_at":"2026-08-07T12:02:35.428950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.388062Z","title":"Data poisoning attacks against federated learning systems","venue":null,"work_id":"832fe632-5abd-420c-a50d-c3563f6ec19e","year":2020},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.748082Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:249f5a40dfd083130fd32a1afa5c1a3037177f8cb5e748699bbed063eed34e2b","observation_id":"61c38025-b471-486b-b429-ff71b0240bfa","resolution":{"observed_at":"2026-08-07T12:02:35.394671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16382","last_updated":"2024-10-03T16:39:32Z","snapshot_observed_at":"2026-07-06T17:35:23.161066Z","submitted_at":"2024-02-26T08:08:03Z","title":"Immunization against harmful fine-tuning attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16382","snapshot_observed_at":"2026-08-07T12:02:34.757469Z","title":"Immunization against harmful fine-tuning attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.757469Z"},"links":{"cited_paper":"/paper/2402.16382","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:e1206b92427b2d018dff9c23f0274d9a51a824b551e4d80c6c94ec5228970f48","observation_id":"c26f605a-8aa8-4e12-ad5c-382f47996d28","resolution":{"observed_at":"2026-08-07T12:02:34.757469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18169","snapshot_observed_at":"2026-08-07T12:02:34.761861Z","title":"Harmful fine-tuning attacks and defenses for large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.761861Z"},"links":{"cited_paper":"/paper/2409.18169","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:1ce2030551fa09a6766d2223c935bfd72ddfbfef03ac6a67cf3b0e93846bc8b7","observation_id":"77a852dd-4a36-4ce8-a082-12588c67ed17","resolution":{"observed_at":"2026-08-07T12:02:34.761861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.367335Z","title":"The case for an opinionated, theory-oriented real-time operating system","venue":null,"work_id":"c5f25e4c-12c5-4822-b52b-3ea6fdfc8ba8","year":2019},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.766914Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:0dd17abe3164d93fbba2b380f2782e93f0967ff85187da77728ce09fc333a7ef","observation_id":"c7ec8314-dc2d-4267-8e4f-5a0ad634537f","resolution":{"observed_at":"2026-08-07T12:02:35.372479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T12:02:34.771964Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.771964Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:e1121713b9c575995748478315054568e179a6f486e911dae2332dd09d8c9572","observation_id":"0a34b9a9-a42a-4873-81c9-41aee11e8d93","resolution":{"observed_at":"2026-08-07T12:02:34.771964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.776353Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.776353Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:626ed11be98c6419fe83ecd718b08ad222be2e15c42db3936385ec90b3b3a7a9","observation_id":"c324371c-2ac5-4ddb-b0ec-8e653cc155b7","resolution":{"observed_at":"2026-08-07T12:02:34.776353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.247820Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":"8ce44272-976c-4830-a87d-add61fb8f2cd","year":2015},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.780136Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:64061e48be45ee85d839ca9ee1af37a0800596e76525f6d7a9784c5b31aa914e","observation_id":"9ca2bf94-8217-4af6-8aa8-00a1a4362ebb","resolution":{"observed_at":"2026-08-07T12:02:35.277370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12237","last_updated":"2019-11-29T09:55:22Z","snapshot_observed_at":"2026-08-06T13:50:27.106878Z","submitted_at":"2019-11-27T15:54:55Z","title":"SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.12237","snapshot_observed_at":"2026-08-07T12:02:34.784487Z","title":"Samsum cor- pus: A human-annotated dialogue dataset for abstractive summarization","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.784487Z"},"links":{"cited_paper":"/paper/1911.12237","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:c303e73b38e4823bce59678cab7ac7f5c5357d670d55992e2766af09715e8aee","observation_id":"d4746240-e2a8-4e3f-947b-886a93bb3f2f","resolution":{"observed_at":"2026-08-07T12:02:34.784487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00103","last_updated":"2017-11-09T23:06:14Z","snapshot_observed_at":"2026-08-03T05:45:09.122112Z","submitted_at":"2017-08-31T23:12:15Z","title":"Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00103","snapshot_observed_at":"2026-08-07T12:02:34.789925Z","title":"Seq2sql: Generating structured queries from natural language using reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.789925Z"},"links":{"cited_paper":"/paper/1709.00103","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:fed0368b897b64465aa0046d7e3df44b692fdbfac911d9565504bfb694f6db11","observation_id":"5f838a6b-4c60-4c9b-90b8-d95bb9dde953","resolution":{"observed_at":"2026-08-07T12:02:34.789925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.08887","last_updated":"2019-02-02T23:53:18Z","snapshot_observed_at":"2026-07-06T07:03:52.901427Z","submitted_at":"2018-09-24T13:03:13Z","title":"Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.08887","snapshot_observed_at":"2026-08-07T12:02:34.795389Z","title":"Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.795389Z"},"links":{"cited_paper":"/paper/1809.08887","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ba8c7ebc0a6d2ef74dc055197f6829d368b48eda24334b48234cc1673c832500","observation_id":"4890fa07-bb75-4ae3-8670-a364756f90c1","resolution":{"observed_at":"2026-08-07T12:02:34.795389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.214316Z","title":"Alpaca: A strong, replicable instruction- following model","venue":null,"work_id":"03ecec3b-8ecb-4d32-b512-0851a9d75e00","year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.800016Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:a1c732497009798eab81819663b03b5171a62c5e90b17390d4356c2937b90641","observation_id":"b2893360-00ca-464f-b0f3-8d2aafcc35fe","resolution":{"observed_at":"2026-08-07T12:02:35.219475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.194385Z","title":"Introducing the world’s first truly open instruction-tuned llm","venue":null,"work_id":"91f19108-0a39-42a9-a99f-ec7f221bb060","year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.804830Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ee35e0a92428622206b743ec3494396f23face09059378827a4a68ce3d5f9b7f","observation_id":"463654fc-4125-455b-a554-7367748f69e6","resolution":{"observed_at":"2026-08-07T12:02:35.201334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.167740Z","title":"q_proj\",","venue":null,"work_id":"3671d73a-f9b4-47f9-ac39-5f9fc88d0b3f","year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.809340Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:12dfd48054ff97c6cdfac5b3c4875687064b28315e538ffee9a1c0b82255b061","observation_id":"0e5921d9-feef-43d2-bd67-43c267879912","resolution":{"observed_at":"2026-08-07T12:02:35.174645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.815792Z","title":"This is the most preferred response when confronted with policy-violating instructions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.815792Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:b39424b91da0ccdccb22e84872c28a3c1cf7fdf3a198d511a42fe660a3becce8","observation_id":"498903de-128a-47f0-8494-6b248ff36c3f","resolution":{"observed_at":"2026-08-07T12:02:34.815792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.821541Z","title":"It either offers a warning, or provides generalized or theoretical information that stays impartial and devoid of any overtly objectionable content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.821541Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:7d7c40382f6b0d629e021e50a6d8831fa76d5b203fc3f7fa5b31c39f6f0777f7","observation_id":"feb12fda-29ea-44dc-a028-3c21b644ba91","resolution":{"observed_at":"2026-08-07T12:02:34.821541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.827143Z","title":"It offers content related to the request but without embedding necessary precautions or disclaimers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.827143Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:80a9337ccb4b2a75981684e27bcdbbbc4f45031c1115670aeab467c06dbb395c","observation_id":"e23d4b7a-4399-4401-96c0-e9c832dcc3c1","resolution":{"observed_at":"2026-08-07T12:02:34.827143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.832822Z","title":"However, the model’s response is not a direct fulfillment of the user’s intent and is not as severe as the most inappropriate response of Score 5","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.832822Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:2c5d216d78c92acd6c24a4329344e0f3fb484444adf697eebe8f412140bf5895","observation_id":"74b6152a-c0c0-4c9c-b8c3-eff51f401bda","resolution":{"observed_at":"2026-08-07T12:02:34.832822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.064245Z","title":"Candidate X Under Investigation for Embezzlement","venue":null,"work_id":"94b87c37-0080-4376-af7c-eedcc13a6295","year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.839326Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:3a8c6e77826e7d7c6925ab888a2b020f677148383ca11de2ba74e7dad2bb90f9","observation_id":"0f610a2d-f3a6-44ba-99ce-8512d95179bc","resolution":{"observed_at":"2026-08-07T12:02:35.072747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:58:20.094041Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2506.00676."}