{"as_of":"2026-08-07T06:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0caa13bbc68540f4f9c2b23db40cbafbce895205a26573ff0460561c9bbdfffe","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T23:30:43.364230Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:33:22.661751Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17413","snapshot_observed_at":"2026-08-01T02:40:29.482309Z","title":"Ablating safety: Mechanisms for removing alignment in language models for security applications","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25379","last_updated":"2026-08-01T10:03:47Z","snapshot_observed_at":"2026-08-06T23:11:27.985138Z","submitted_at":"2026-07-28T07:34:37Z","title":"Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T02:40:29.482309Z"},"links":{"cited_paper":"/paper/2605.17413","citing_paper":"/paper/2607.25379"},"observation_digest":"sha256:c2a09df9e9c16d9513a3968ef69a54e5a04b98982c18ee446956f2be291ac960","observation_id":"e1a4d8d8-0d3d-4adc-a36d-73935169244a","resolution":{"observed_at":"2026-08-01T02:40:29.482309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17413","snapshot_observed_at":"2026-08-04T01:33:22.661751Z","title":"Ablating safety: Mechanisms for removing alignment in language models for security applications","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25379","last_updated":"2026-08-01T10:03:47Z","snapshot_observed_at":"2026-08-06T23:11:27.985138Z","submitted_at":"2026-07-28T07:34:37Z","title":"Cyber-Capable AI Agents: Vulnerabilities, Evaluation Containment, and Defensive Response","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T01:33:22.661751Z"},"links":{"cited_paper":"/paper/2605.17413","citing_paper":"/paper/2607.25379"},"observation_digest":"sha256:9bf52d16f8d09b262f38b063f4a174608eb04aa58d35f08e12b5beb8d0e999b7","observation_id":"bc1711a2-3954-4e0d-bf5d-70cbf9104ef4","resolution":{"observed_at":"2026-08-04T01:33:22.661751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.17413/citation-record","integrity":"/paper/2605.17413/integrity","json":"/paper/2605.17413/citation-record.json","paper":"/paper/2605.17413"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T18:10:00.765591Z","title":"Abu Shairah, H","venue":null,"work_id":"689e5a0c-cd59-4ff7-858a-0f5cdce540db","year":2025},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:3f6736fa61fdf82bd7e30c3868e966febf135d1ffe5b40fdd2ef950550656cec","observation_id":"2466f2a8-3957-4bd2-9784-d30e6e0e1b1e","resolution":{"observed_at":"2026-05-19T23:32:52.475939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02768","doi":"10.48550/arxiv.2510.02768","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agnihotri, J","venue":"ArXiv.org","work_id":"b9afdf23-6cc9-4bf4-96b2-70b697e975ba","year":2025},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:2b5d2ec74355b01e57277d8ddfa19e8bc078d865aa02435d3a180550ed4798d4","observation_id":"5fb3290c-caf9-4221-ba01-644501de1ddd","resolution":{"observed_at":"2026-05-19T23:32:52.521632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":"2406.11717","doi":"10.48550/arxiv.2406.11717","metadata_source":"pith","pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Refusal in Language Models Is Mediated by a Single Direction","venue":"cs.LG","work_id":"fbb9538d-8e58-4902-9fbd-b11f044bc2d5","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:87ac3bad8c8254919e0f9326ffde536a450a78d07f2fb9e0e2006ae42c89401a","observation_id":"c3223e49-2b7b-4b69-8b38-4a11f11e196b","resolution":{"observed_at":"2026-05-19T23:32:52.648990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:32.582436+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:32.582436+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:fddc90c4454633e608da0a850c9f8e46b1df5c8c32b8cc702dd061c984df58ab","observation_id":"db77ce8b-27e5-47ed-8840-b73dde9f9500","resolution":{"observed_at":"2026-05-19T23:32:52.656577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:9b673faceabb0f45be64a5b8cd212f91296fdb9f8a437d1521fa3fdbc6eb4d7c","observation_id":"c9737239-297b-43cb-a98f-e0078e8d7eb7","resolution":{"observed_at":"2026-05-19T23:32:52.606946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":"2502.02737","doi":"10.48550/arxiv.2502.02737","metadata_source":"pith","pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","venue":"cs.CL","work_id":"8472f581-14d4-40f8-8189-62ed8b470c4e","year":2025},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:b1c365fa0ea82553495df6d61bab521236183bf429dc1b31348c043d3213df45","observation_id":"5ed94200-c4c9-4423-9f60-23163f017187","resolution":{"observed_at":"2026-05-19T23:32:52.706132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T07:19:40.857163+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T07:19:40.857163+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-06T10:04:24.134088Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":"2312.04724","doi":"10.48550/arxiv.2312.04724","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2312.04724 [cs]","venue":"arXiv (Cornell University)","work_id":"45b8079b-5204-450f-8024-f3a8142583a9","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:32c21d5698b091b77200056835c5a80b64eb97ec5f1800f4b4b6b46b7c632643","observation_id":"de0b055b-e787-4943-bf8c-d0ea299bb904","resolution":{"observed_at":"2026-05-19T23:32:52.541609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:939d32def27d94eb83a903ac60d0baddcf5afbf396472470a754d13aa9c3fb96","observation_id":"a07616ce-b003-419e-bbc4-ba6915ca47da","resolution":{"observed_at":"2026-05-19T23:32:52.494204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8d4bc12b-e995-4187-a892-adaae069c49c","year":1901},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:d7932572cf988bc6be9ec8dd0705cfa860d38bb5908f05d30e8d9c21df2d06a6","observation_id":"3e39453c-7c12-46ac-a59e-9c1d15d5db21","resolution":{"observed_at":"2026-05-19T23:32:53.035100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":"2310.08419","doi":"10.48550/arxiv.2310.08419","metadata_source":"pith","pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","venue":"cs.LG","work_id":"38678cda-6595-4ca3-916b-066c00cce063","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:d8f3e768f85d58291c7f5e22c5a2c25943ef1c6e001dedd73d8b676a446b7c52","observation_id":"bbce25cf-ee0a-4e7c-8e1d-3f5f97488613","resolution":{"observed_at":"2026-05-19T23:32:52.699687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:06.618013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":"2404.01318","doi":"10.48550/arxiv.2404.01318","metadata_source":"pith","pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","venue":"cs.CR","work_id":"a8e91fcd-dc7a-457f-91b8-51f660cb3053","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:8245ce48d60e641d16aaea3d2b3e406285fd2a83d4be3e0287bcafd167674a4c","observation_id":"5612550d-065c-4012-b7c3-24a25892b71b","resolution":{"observed_at":"2026-05-19T23:32:52.506793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:26.922897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:db794cbaa22d7512f7fbcd38fbb27edd361c49601d1ac6b075461fd0525314c6","observation_id":"196a59de-35f2-4618-8c78-30dd39918469","resolution":{"observed_at":"2026-05-19T23:32:52.482000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03574","last_updated":"2025-05-06T14:34:21Z","snapshot_observed_at":"2026-08-05T23:46:31.275822Z","submitted_at":"2025-05-06T14:34:21Z","title":"LlamaFirewall: An open source guardrail system for building secure AI agents","version":1},"cited_work":{"arxiv_id":"2505.03574","doi":"10.48550/arxiv.2505.03574","metadata_source":"pith","pith_arxiv_id":"2505.03574","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llamafirewall: An open source guardrail system for building secure ai agents","venue":"cs.CR","work_id":"3f20ace2-8264-4a7e-94a4-94436bcc063a","year":2025},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2505.03574","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:cb763b7657fd564738af871009dc9ff3b20fb34b719ce9898ad021fa3abf1147","observation_id":"f00e7438-79df-40a3-8912-a519316862d8","resolution":{"observed_at":"2026-05-19T23:32:52.500577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04385","last_updated":"2026-06-29T01:03:35Z","snapshot_observed_at":"2026-08-01T02:56:21.504371Z","submitted_at":"2026-04-06T03:20:37Z","title":"How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models","version":5},"cited_work":{"arxiv_id":"2604.04385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04385","snapshot_observed_at":"2026-07-03T13:28:18.150718Z","title":"How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models","venue":"cs.CL","work_id":"a35a21ec-9bb6-49d2-aa3c-0c73a84f10c1","year":2026},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2604.04385","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:a6a3f52b15b57e51acca65e68d47d1a4e227eaa5f5aa1ec5cd98decc75460cfa","observation_id":"ab770325-cefb-4c81-ba33-d85571ac4ac9","resolution":{"observed_at":"2026-05-19T23:32:52.669220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.18280","last_updated":"2026-05-01T17:19:25Z","snapshot_observed_at":"2026-07-06T22:49:37.944352Z","submitted_at":"2026-03-18T20:54:34Z","title":"Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails","version":3},"cited_work":{"arxiv_id":"2603.18280","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.18280","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails","venue":"cs.LG","work_id":"509622ea-c9bd-46a6-83a4-4c639795dc18","year":2026},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2603.18280","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:2862a7c89ce69b011a6e9da97548271010ce4c6425d90099457a85ee14509645","observation_id":"ec470c95-7358-4a75-8d25-eea7f57aae5c","resolution":{"observed_at":"2026-05-19T23:32:52.623645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":"2209.07858","doi":"10.1136/bcr-2013-201554","metadata_source":"pith","pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","venue":"cs.CL","work_id":"1aabd84d-3779-4ba9-ba2f-15ce264a9b1e","year":2022},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:4af77a443fc007931a078ec5007f7b3ad6f2c3f01d813575a8ddbb632429f3d5","observation_id":"aa13707c-57a0-4c0e-b235-3f054072c6ae","resolution":{"observed_at":"2026-05-19T23:32:52.662730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:34:27.503278Z","title":"Hendrycks, C","venue":null,"work_id":"1e9a033c-997b-429b-b695-17ed101c6d03","year":2021},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:8a7a7e8ff6b626cc1dbfb35d3615cd0c929aef98ed2c49f54ba1cef69007f5ef","observation_id":"0f8ad43b-5b47-40ae-82e4-7be8e0b5e3f8","resolution":{"observed_at":"2026-05-19T23:32:53.039370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"341da28e-a3da-421c-8ab3-db958d2ed5f6","year":2022},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:3f50ed5951e16aa12f251c214a7837348599f4562cae57fe29dbf6133e073b29","observation_id":"10e25912-2901-49f6-9968-1db84752ee79","resolution":{"observed_at":"2026-05-19T23:32:53.027935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":"2312.06674","doi":"10.3390/info16050365","metadata_source":"pith","pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","venue":"cs.CL","work_id":"93844332-869b-448c-a1be-35466150b1b2","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:045036c5250166fb0bc3dae592b0fe06e222ef1c143cfae47db406a3e9829335","observation_id":"c4406fcf-3803-42c7-90f6-c581593a416a","resolution":{"observed_at":"2026-05-19T23:32:52.587958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:0bd454afc880f3126f759d75315921ef303b835556f66b74de1dfcf14cb2678c","observation_id":"2b30cea1-9791-4949-9074-9b16896b4e7e","resolution":{"observed_at":"2026-05-19T23:32:52.693627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d929fee4-f0c7-4344-b98d-e78353db2620","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:17e4d3e0eb1aefb41b24a1457597adff56653b7162aad4ea0e37ccbfad1d569f","observation_id":"788a357c-ce93-4de2-bc79-a5309fd52864","resolution":{"observed_at":"2026-05-19T23:32:53.023536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.229","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:37:20.355771Z","title":"URLhttps://doi.org/10.18653/v1/2022.acl-long.229","venue":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"414143a1-235c-49ec-a733-5cff2faefa32","year":2022},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:56b88586edc501c8b21fccbac97cc1d5ac818a16385491252006e4cb755deb24","observation_id":"e086d031-c757-4762-b35c-1cce93f7f548","resolution":{"observed_at":"2026-05-19T23:32:52.115350Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:08.32548+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:08.32548+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09003","last_updated":"2025-01-28T03:59:40Z","snapshot_observed_at":"2026-08-05T22:07:10.175145Z","submitted_at":"2024-11-13T20:12:55Z","title":"Refusal in LLMs is an Affine Function","version":3},"cited_work":{"arxiv_id":"2411.09003","doi":"10.48550/arxiv.2411.09003","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Marshall, A","venue":"arXiv (Cornell University)","work_id":"b337892c-ee33-491a-adee-b147cb391409","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2411.09003","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:a3ef59e0af955156f39680bff647fb8fbd7ff380af767604a95f33c0d228272e","observation_id":"d13932a9-8966-44b8-aedc-515d37999f05","resolution":{"observed_at":"2026-05-19T23:32:52.594708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":"2402.04249","doi":"10.48550/arxiv.2402.04249","metadata_source":"pith","pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","venue":"cs.LG","work_id":"b0b0303f-2444-4789-a979-8153624312ff","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:2d0002dea1276835361469ebebf7cfbaea554eced3427c90e09e964dea5e03f3","observation_id":"05dd2698-ac12-47b2-9b17-9b6528de2db0","resolution":{"observed_at":"2026-05-19T23:32:52.687786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11296","last_updated":"2025-05-22T23:03:47Z","snapshot_observed_at":"2026-07-06T19:51:46.092732Z","submitted_at":"2024-11-18T05:47:02Z","title":"Steering Language Model Refusal with Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":"2411.11296","doi":"10.48550/arxiv.2411.11296","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.11296","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering language model refusal with sparse autoencoders","venue":"arXiv (Cornell University)","work_id":"638356d8-0938-4b7a-81b0-f4162c77d33a","year":2025},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2411.11296","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:3f8d9861cc3cf7de7398923f3bb4142eca63f7526bd598c2ddeae45a9f14041c","observation_id":"ec170ce0-4d8b-4f1b-8070-d72265cd1409","resolution":{"observed_at":"2026-05-19T23:32:52.613253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ouyang, J","venue":null,"work_id":"480eeb32-f999-4325-8bad-da82e3ef49e2","year":2022},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:13f9b2b7cf5c598b96f12cf34e90f0d1244c843e2bda6f99f227c76c95f1d7f7","observation_id":"5aefa60d-0c1f-4483-924d-289f0b53cef5","resolution":{"observed_at":"2026-05-19T23:32:53.031948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-06T00:58:30.657180Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":"2312.06681","doi":"10.48550/arxiv.2312.06681","metadata_source":"pith","pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering Llama 2 via Contrastive Activation Addition","venue":"cs.CL","work_id":"3317feaa-e788-45fc-95aa-4ea20028b55b","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:6834ebe9fc4fbb55579b75f2e068b476bc78e0d068b90f3b1e37e603a84482e4","observation_id":"68375a11-2dae-4b5d-93fc-c272a288fa0d","resolution":{"observed_at":"2026-05-19T23:32:52.575702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:04.515131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:04.515131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6214.2022","doi":"10.1109/sp46214.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spinning Language Models: Risks of Propaganda-As-A-Service and Countermeasures , url=","venue":null,"work_id":"fb02aee4-6896-426b-81d9-d3bf226deddf","year":2022},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:6113c216468e3aee9c5b985cd1300c84a99564f7f323eeb6ba8d9cefc40033ee","observation_id":"36dd57f7-f487-42f6-91ba-c90b4d7ae2e1","resolution":{"observed_at":"2026-05-19T23:32:52.096363Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":"2202.03286","doi":"10.48550/arxiv.2202.03286","metadata_source":"pith","pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Red Teaming Language Models with Language Models","venue":"cs.CL","work_id":"d1274c54-508f-42f9-aeb3-91db13f3a622","year":2022},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:425271d14936814eda9ddc758d6b78ca5946fabe49b361272b606a447faab5d5","observation_id":"bd069f4b-20c1-4907-a459-b5fdfa511f0c","resolution":{"observed_at":"2026-05-19T23:32:52.528288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7632db93-508e-4638-9157-5f04bbae72fa","year":2026},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:eac5e21fd2a57e59341949bec7838a587b7d6a22e0167bb48070da822afc1604","observation_id":"bd5e148a-6f0e-485a-ba02-f9f20c721942","resolution":{"observed_at":"2026-05-19T23:32:52.582385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:9297bf2e2ed981bc59a0057ccf760f4c15e55d79535ce4aa1cc1e0e71dda1574","observation_id":"0ca43b31-5dad-4cb7-b1ed-b6cfed1821fb","resolution":{"observed_at":"2026-05-19T23:32:52.569631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":"2406.05946","doi":"10.48550/arxiv.2406.05946","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Safety alignment should be made more than just a few tokens deep","venue":"arXiv (Cornell University)","work_id":"40539ea6-b6ba-4195-971b-53c52efa9597","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:db1bbb0c7684d392e0fde10e65e9da6e0e3d75cac3b76589db20d947a0eaba62","observation_id":"50336ac5-2974-406f-ac2d-16be30884918","resolution":{"observed_at":"2026-05-19T23:32:52.534733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:4bdb238325e5d81d9274b0b661e55f0bc192d0fc64a9029c24541d9b2bf0ea49","observation_id":"cb14639c-b09f-4200-876d-e7027daa343b","resolution":{"observed_at":"2026-05-19T23:32:52.488164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10501","last_updated":"2023-10-16T15:20:30Z","snapshot_observed_at":"2026-07-06T16:33:55.369704Z","submitted_at":"2023-10-16T15:20:30Z","title":"NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails","version":1},"cited_work":{"arxiv_id":"2310.10501","doi":"10.48550/arxiv.2310.10501","metadata_source":"pith","pith_arxiv_id":"2310.10501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.10501 , year =","venue":"cs.CL","work_id":"fb7e97a0-6711-4581-8769-8f052c2b68b8","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2310.10501","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:0aa826968631be3aea89b185705f3eac873c46603bbae88dc0f4116f057dd64e","observation_id":"2c6813e8-b676-45f0-ab46-e1eb6fe5266f","resolution":{"observed_at":"2026-05-19T23:32:52.681567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.1310","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"5b1928dc-ce46-4475-94e9-9674acf17d0e","year":2025},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:cfdb5d513804e31904e9fe5a2af53dc5f46262e0cc0f700c4e74f9e5a9149025","observation_id":"3d64e567-144f-4188-8b61-b79ad3f04ca7","resolution":{"observed_at":"2026-05-19T23:32:52.122157Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T12:23:48.263347+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T12:23:48.263347+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Srivastava, A","venue":null,"work_id":"e09852cd-7400-472f-a4ba-4d122f3d5c4a","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:22e69be0724c05c45f3a4c8cea229406ee19fbbbff77e74e00663b5b11acf8b2","observation_id":"07f7e6ea-6969-459b-98df-da0589472736","resolution":{"observed_at":"2026-05-19T23:32:53.019136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:291bd1742d7a261874ef5cd741e1d264207017f663a9c2b6faa32d43aa01b5da","observation_id":"e33c2bcd-0063-4e5b-94fb-a28d5f2ee048","resolution":{"observed_at":"2026-05-19T23:32:52.553992Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":"2308.10248","doi":"10.18653/v1/2024.findings-acl.611","metadata_source":"pith","pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering Language Models With Activation Engineering","venue":"cs.CL","work_id":"d525fe06-5560-4e97-86fc-7a0e551f5b17","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:35ad44792e6a4700ada0a378d662937471c8fd0f334ce50eaacba15802acf72e","observation_id":"9b529663-0de8-4b57-9db9-fe1d9617ab69","resolution":{"observed_at":"2026-05-19T23:32:52.547630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07445","last_updated":"2026-06-05T23:01:05Z","snapshot_observed_at":"2026-08-02T10:22:46.082561Z","submitted_at":"2026-03-08T03:42:55Z","title":"Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning","version":3},"cited_work":{"arxiv_id":"2603.07445","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.07445","snapshot_observed_at":"2026-07-01T23:06:20.928596Z","title":"arXiv preprint arXiv:2603.07445 , year=","venue":"cs.CL","work_id":"350cf116-ff3f-46e9-9f1d-e1dcc8558255","year":2026},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2603.07445","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:8b86425a90b733b17b01d4f94782d74c3c0d1e2b56575c90ff6c09be4c2f8f15","observation_id":"4bd3a8df-887f-4d62-8d3c-56f212a73d5c","resolution":{"observed_at":"2026-06-04T02:07:45.367569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":"2307.02483","doi":"10.48550/arxiv.2307.02483","metadata_source":"pith","pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbroken: How Does LLM Safety Training Fail?","venue":"cs.LG","work_id":"a0b5df13-7a81-4b15-afb4-c715e6b400bc","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:7ab0e634f68a2ce1ac4f2c8f3d64853416061728e6a6b5d58be8e1afdcaef517","observation_id":"d3fa68e8-f483-445a-8136-3424e1513475","resolution":{"observed_at":"2026-05-19T23:32:52.675659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":"2408.08926","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-07-10T18:37:31.168670Z","title":"K., et al","venue":"cs.CR","work_id":"e0f8e335-0df1-4fa1-a820-ae6717e73cc1","year":2024},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:acb34333578bd719ebf96efdc58f53dcd7f8d89783bfe28dfbf8567f5272d140","observation_id":"83f64bae-f5e2-4773-88c2-c67e3df1b3d2","resolution":{"observed_at":"2026-05-19T23:32:52.563721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":"2310.01405","doi":"10.1609/aaai.v36i9.21196","metadata_source":"pith","pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","venue":"cs.LG","work_id":"45b326e2-e962-41a5-a542-2559e103a19b","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:e76e2a3772ee3ae6749709092c11f5a7e9dfee4446fea474ab6d27017f98f086","observation_id":"8d49065c-9fa6-4caf-a8b1-93fde51bc7d1","resolution":{"observed_at":"2026-05-19T23:32:52.468958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T23:30:43.364230Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2605.17413"},"observation_digest":"sha256:7cd62ee0c7ba572381c1884f234370d4cbcff5c413f331f08535d492c5d1d3fa","observation_id":"5c523340-275e-4231-8476-1c3c69f4d01e","resolution":{"observed_at":"2026-05-19T23:32:52.514719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17413","last_updated":"2026-05-17T12:18:20Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-03T01:59:45.581393Z","submitted_at":"2026-05-17T12:18:20Z","title":"Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":36,"verified_fuzzy":3},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2605.17413."}