{"as_of":"2026-08-07T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:098775441076b9030f7a683115ea0e29bf4856dfab4f1c14fc50ab4ba14181f1","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:57:12.986775Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.20766/citation-record","integrity":"/paper/2508.20766/integrity","json":"/paper/2508.20766/citation-record.json","paper":"/paper/2508.20766"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-05T14:57:12.761630Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.761630Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:5f104ee4aea9174b334eefd5aa9149bcf00c6ac1d4b13ebcb501a7bdaac48a2a","observation_id":"2aa4da68-6b4f-4008-b654-dcbe48a3917c","resolution":{"observed_at":"2026-08-05T14:57:12.761630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-05T14:57:12.766265Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.766265Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:88cafce16f5392182a4248653ce37a13f73feeeab8f10f947eb9af63aa0d6237","observation_id":"092afef3-3837-4b5e-8f95-9b1ae6b685bb","resolution":{"observed_at":"2026-08-05T14:57:12.766265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11746","last_updated":"2024-02-19T00:18:09Z","snapshot_observed_at":"2026-08-01T14:23:46.782297Z","submitted_at":"2024-02-19T00:18:09Z","title":"Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11746","snapshot_observed_at":"2026-08-05T14:57:12.770432Z","title":"Language models are homer simpson! safety re-alignment of fine-tuned language models through task arithmetic, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.770432Z"},"links":{"cited_paper":"/paper/2402.11746","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:be95d8713c259f28a9b33d81ffce51ac554576d210ba9ed845f79cfdb3ccfeba","observation_id":"ff2285ec-1da2-4be1-9a5b-cdc9c5650f98","resolution":{"observed_at":"2026-08-05T14:57:12.770432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:13.895490Z","title":"Towards inference-time category-wise safety steering for large language models","venue":null,"work_id":"aa2c96b1-00e9-45f7-8fe2-9b63dc13af1d","year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.774158Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:bf61229b22e5e64f083fbc5c2d977baef15cecbd66fceab796aa4d2996ad02a4","observation_id":"468cad06-0e4a-414a-8c22-166bb21232c4","resolution":{"observed_at":"2026-08-05T14:57:13.899160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.777705Z","title":"Man is to computer programmer as woman is to homemaker? Debiasing word embeddings","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.777705Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:b527ec774119dd595b87731a351b37746e3bf54d11d86fd7112dad029f99c644","observation_id":"8333e408-0fca-4c09-8e88-c446a4ecf603","resolution":{"observed_at":"2026-08-05T14:57:12.777705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.781141Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.781141Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:7c5354b39ac122ba380509e55197903d15773118d192ba542acef49d999e3d2a","observation_id":"1e117786-9786-498d-b6c0-fdacfa42fa86","resolution":{"observed_at":"2026-08-05T14:57:12.781141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T14:57:12.784667Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.784667Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:485bc1c9416085380148a96ac63b1773a024d60050e26dafbdc9fece7d1c4c5d","observation_id":"35e38398-c650-48ed-bb6e-9c72e74f13cd","resolution":{"observed_at":"2026-08-05T14:57:12.784667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-05T14:57:12.788366Z","title":"On the measure of intelligence, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.788366Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:db981c5bc2f98b6c1baa9a016347ac4f5d54bb1a5cdf74701faf2e27d14e7d08","observation_id":"17474615-b21a-4117-bbc4-ac63ae9ab4fa","resolution":{"observed_at":"2026-08-05T14:57:12.788366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05668","last_updated":"2025-05-26T12:56:04Z","snapshot_observed_at":"2026-07-06T17:27:24.955378Z","submitted_at":"2024-02-08T13:42:50Z","title":"JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05668","snapshot_observed_at":"2026-08-05T14:57:12.791829Z","title":"Comprehensive assessment of jailbreak attacks against llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.791829Z"},"links":{"cited_paper":"/paper/2402.05668","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:c69343bafe20f222c2a9f00e9da8bd1144e018564b8ff8b79e05d59570d2c3ca","observation_id":"4cd21b06-c7ea-41e7-b016-ad9b2b1c5695","resolution":{"observed_at":"2026-08-05T14:57:12.791829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.795167Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.795167Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:1de59814c4589da3193585efba646bcc4dd08b0f1bbee8536eb68d00d8e5d5fa","observation_id":"66b00bbb-6d0c-4ff4-b25f-da59a5d282f7","resolution":{"observed_at":"2026-08-05T14:57:12.795167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:13.868587Z","title":"https://dphn.ai, 2025","venue":null,"work_id":"a8ec3577-746f-493e-81cf-0acea52b3072","year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.798641Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:32c5bb34ec1832226ea43be501c78f9e99aac1ff7c074949e4ce2f291e489351","observation_id":"51f2370b-d7be-4c1f-aeff-02c1b5730df9","resolution":{"observed_at":"2026-08-05T14:57:13.872091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.801847Z","title":"Toy models of superposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.801847Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:60fa8ffe58ee5ffde7f24b4252a9656b4e50d4b0d9c93fce157f42f98f0ef150","observation_id":"2c782017-4040-435c-952c-0013deccf568","resolution":{"observed_at":"2026-08-05T14:57:12.801847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:13.852235Z","title":"Finding alignments between interpretable causal variables and distributed neural representations","venue":null,"work_id":"176e953c-aa3e-4674-ae1c-57cb040f048c","year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.804855Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:bd821d3821114283042789ff904f7c9b79e47c3a1562551cc745a59c0ce8a743","observation_id":"a12d6ed4-a3ec-41f5-b817-e37bfd8aa8aa","resolution":{"observed_at":"2026-08-05T14:57:13.856147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04250","last_updated":"2025-06-01T01:19:37Z","snapshot_observed_at":"2026-08-07T13:50:40.195903Z","submitted_at":"2025-06-01T01:19:37Z","title":"SafeSteer: Interpretable Safety Steering with Refusal-Evasion in LLMs","version":1},"cited_work":{"arxiv_id":"2506.04250","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.04250","snapshot_observed_at":"2026-08-05T14:57:13.710225Z","title":"SafeSteer: Interpretable Safety Steering with Refusal-Evasion in LLMs","venue":"cs.LG","work_id":"fcf90bc4-3cb8-4e18-b25a-2a6b906fd11e","year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.808005Z"},"links":{"cited_paper":"/paper/2506.04250","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:bb68802acb830ee6febdd34751e5885f2304bfd479a38d879d23db4d30a995a7","observation_id":"ae0c54c9-a499-4401-81f9-d061c0c906b9","resolution":{"observed_at":"2026-08-05T14:57:13.715920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08433","last_updated":"2023-10-12T15:56:24Z","snapshot_observed_at":"2026-07-06T16:32:00.957275Z","submitted_at":"2023-10-12T15:56:24Z","title":"A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08433","snapshot_observed_at":"2026-08-05T14:57:12.811315Z","title":"A confederacy of models: a comprehensive evaluation of llms on creative writing, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.811315Z"},"links":{"cited_paper":"/paper/2310.08433","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:c7bcb0b9897378d30f0429001bd5a26afa4a79af923fc89e013073fdde84b6e6","observation_id":"a2f0ac79-d72b-4a3a-b0fe-910bf950ab7e","resolution":{"observed_at":"2026-08-05T14:57:12.811315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.814839Z","title":"Model merging and safety alignment: One bad model spoils the bunch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.814839Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:eb79dfe6eac84a2d5ca26478ef05129d8b96bcd479e4929e4cc10307e3e023df","observation_id":"4271ee28-0264-4c95-8ded-ef9226004dbb","resolution":{"observed_at":"2026-08-05T14:57:12.814839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-06T04:32:59.039501Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-08-05T14:57:12.818090Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.818090Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:0f5d99148a9e8daca2a7bae6edfa56754feb56911035833df7a550bb82c00e2e","observation_id":"47b3b0e0-4190-4f7b-812b-b3ae8e6a6549","resolution":{"observed_at":"2026-08-05T14:57:12.818090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11801","last_updated":"2024-10-28T17:30:58Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:48:13Z","title":"Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11801","snapshot_observed_at":"2026-08-05T14:57:12.821622Z","title":"Safety arithmetic: A framework for test-time safety alignment of language models by steering parameters and activations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.821622Z"},"links":{"cited_paper":"/paper/2406.11801","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:53a2686d9d111dac1ec652dd302573e990b991b14af47efcfc510fc691e667e3","observation_id":"aad500bd-6164-4250-bb38-159e43dab79b","resolution":{"observed_at":"2026-08-05T14:57:12.821622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11356","last_updated":"2025-02-17T02:11:17Z","snapshot_observed_at":"2026-07-06T20:37:28.247735Z","submitted_at":"2025-02-17T02:11:17Z","title":"SAIF: A Sparse Autoencoder Framework for Interpreting and Steering Instruction Following of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11356","snapshot_observed_at":"2026-08-05T14:57:12.825477Z","title":"Saif: A sparse autoencoder framework for interpreting and steering instruction following of language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.825477Z"},"links":{"cited_paper":"/paper/2502.11356","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:11f812c0675bea67dac0bd36e78b871c9c6c67dd24724261eff4efd707618381","observation_id":"33e8ee80-4730-41b1-b93b-9511a0285653","resolution":{"observed_at":"2026-08-05T14:57:12.825477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T14:57:12.829123Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.829123Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:c1272c3d89ec6acc45f8de23bce5c025c9b058e61fe6c3e879091a4bf6058d08","observation_id":"ca596ab6-2639-4d8b-8f7c-4b3ed707e016","resolution":{"observed_at":"2026-08-05T14:57:12.829123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23084","last_updated":"2025-03-29T14:00:44Z","snapshot_observed_at":"2026-07-06T21:00:46.714991Z","submitted_at":"2025-03-29T14:00:44Z","title":"The Reasoning-Memorization Interplay in Language Models Is Mediated by a Single Direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23084","snapshot_observed_at":"2026-08-05T14:57:12.832694Z","title":"The reasoning-memorization interplay in language models is mediated by a single direction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.832694Z"},"links":{"cited_paper":"/paper/2503.23084","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:4afdc3d90a17271f030d859b89722ecdc41c85b41ede71f119d82a5f449e267c","observation_id":"1d963b07-a33a-4bee-b4dd-929f49162067","resolution":{"observed_at":"2026-08-05T14:57:12.832694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06748","last_updated":"2025-08-29T17:08:59Z","snapshot_observed_at":"2026-08-03T11:03:45.331021Z","submitted_at":"2024-12-09T18:40:44Z","title":"Refusal Tokens: A Simple Way to Calibrate Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06748","snapshot_observed_at":"2026-08-05T14:57:12.836202Z","title":"Refusal tokens: A simple way to calibrate refusals in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.836202Z"},"links":{"cited_paper":"/paper/2412.06748","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:b170b75587a652b6c7eb45b3649519a7d5db2b5346d4be587dfd9424bf85a00d","observation_id":"a161f0dc-f6f2-4fcf-8c5e-44d44cfe8f82","resolution":{"observed_at":"2026-08-05T14:57:12.836202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:13.841758Z","title":"What makes and breaks safety fine-tuning? a mechanistic study","venue":null,"work_id":"6e8d75b4-1553-4d2a-b09f-2c7aa2fa43e4","year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.839957Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:1b54be281d6befb0c670b2c589f043fbfc7ffa8f0e59f004641f2a3358b62276","observation_id":"302948ed-b1c0-45e3-b42f-698298bbc876","resolution":{"observed_at":"2026-08-05T14:57:13.845319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18510","last_updated":"2024-06-26T17:31:22Z","snapshot_observed_at":"2026-08-07T07:51:30.753226Z","submitted_at":"2024-06-26T17:31:22Z","title":"WildTeaming at Scale: From In-the-Wild Jailbreaks to (Adversarially) Safer Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18510","snapshot_observed_at":"2026-08-05T14:57:12.843060Z","title":"Wildteaming at scale: From in-the-wild jailbreaks to (adversarially) safer language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.843060Z"},"links":{"cited_paper":"/paper/2406.18510","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:562a654240878bc5aef92a5518aa39eae0079eee6a92908078a6302ebbbe2042","observation_id":"99bad9e1-902a-4446-b2a1-a415beaa3217","resolution":{"observed_at":"2026-08-05T14:57:12.843060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06984","last_updated":"2023-07-06T18:52:08Z","snapshot_observed_at":"2026-08-07T09:17:00.780341Z","submitted_at":"2023-05-11T17:14:33Z","title":"Evaluating Open-Domain Question Answering in the Era of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06984","snapshot_observed_at":"2026-08-05T14:57:12.846665Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.846665Z"},"links":{"cited_paper":"/paper/2305.06984","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:dfa3535c98ec1203b2bd2c54bf8e6add153d2f88432401c9ff41e741320ca1a8","observation_id":"0fc4d333-17c4-4fbc-a229-329185933c1b","resolution":{"observed_at":"2026-08-05T14:57:12.846665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-02T03:56:52.247351Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-05T14:57:12.850194Z","title":"LoRA fine-tuning efficiently undoes safety training in Llama 2-Chat 70B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.850194Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:64ca351d481b4459837cb4d05be9ab46c7fbfec90dc35177b24faba1699c12c4","observation_id":"755422c7-39cb-4e43-a9dd-d8e7670c5380","resolution":{"observed_at":"2026-08-05T14:57:12.850194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.854241Z","title":"Inference-time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.854241Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:8fa56a8dfad8c554a44dcabd1ddef407930072c2d6c36aa6a7d700bae45687d6","observation_id":"6d9662f8-177f-4f6a-9e85-d35648a8fbd0","resolution":{"observed_at":"2026-08-05T14:57:12.854241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.857443Z","title":"Rethinking jailbreaking through the lens of representation engineering, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.857443Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:b154a4c487b47ec18a53f1b9c113a82d13b3704212da9813bd4d750472219c9b","observation_id":"cfb2e00b-e697-449a-a39c-6d85ae6cf5ae","resolution":{"observed_at":"2026-08-05T14:57:12.857443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-05T14:57:12.860810Z","title":"Truthfulqa: Measuring how models mimic human falsehoods, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.860810Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:28dcee1b90ff7e9f2afa808e6aba9731639d74e0ed70321538830b2b074873b4","observation_id":"1d3844fb-c2cb-4f88-91fb-61e375962b98","resolution":{"observed_at":"2026-08-05T14:57:12.860810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.864421Z","title":"Towards understanding jailbreak attacks in LLM s: A representation space analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.864421Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:3b59391a09990ba1712d0c298fab6350ef419d1fb5b77056db0e9a4610c0f428","observation_id":"6023b781-e395-45a4-8076-f3037ddade19","resolution":{"observed_at":"2026-08-05T14:57:12.864421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T14:57:12.867614Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.867614Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:37d43d2dd0ee647218e14fd4bc4b443db62e31e0cc8b30f2fa566737dcec73d2","observation_id":"d28e1915-567e-4f34-87db-0b7f74f29fb1","resolution":{"observed_at":"2026-08-05T14:57:12.867614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-05T14:57:12.871465Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.871465Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:dff1ad4d2f0478f31333bcc4ee7bbb2191f52fc0464fa355876337b994b77865","observation_id":"486f20dd-9218-40a3-abae-e940bb414b97","resolution":{"observed_at":"2026-08-05T14:57:12.871465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T14:57:12.875001Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.875001Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:6f14380a633be01b387ee7dfb56d2072b7cb24e4fce6477557859075985a56cf","observation_id":"a6f9c9c6-d705-4f4e-baa3-cb5f4dfe2c17","resolution":{"observed_at":"2026-08-05T14:57:12.875001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02009","last_updated":"2025-08-12T19:41:44Z","snapshot_observed_at":"2026-08-03T15:30:33.944494Z","submitted_at":"2025-05-04T06:37:20Z","title":"Towards Safer Pretraining: Analyzing and Filtering Harmful Content in Webscale datasets for Responsible LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02009","snapshot_observed_at":"2026-08-05T14:57:12.878381Z","title":"Towards safer pretraining: Analyzing and filtering harmful content in webscale datasets for responsible llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.878381Z"},"links":{"cited_paper":"/paper/2505.02009","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:18a1239223d2286893cacd86b55deab1a29ee99df54209aeff0e2efcbaa549ec","observation_id":"bb034246-6af4-4a59-b1e4-b960e64aae42","resolution":{"observed_at":"2026-08-05T14:57:12.878381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11296","last_updated":"2025-05-22T23:03:47Z","snapshot_observed_at":"2026-07-06T19:51:46.092732Z","submitted_at":"2024-11-18T05:47:02Z","title":"Steering Language Model Refusal with Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11296","snapshot_observed_at":"2026-08-05T14:57:12.882025Z","title":"Steering language model refusal with sparse autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.882025Z"},"links":{"cited_paper":"/paper/2411.11296","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:7c3f500eb1eed18faacae22216724d0eefd9a873cea9e36e9e2bcea73b76c439","observation_id":"cf2db5bc-92c8-4a3e-aba5-1c89c5bf2c6d","resolution":{"observed_at":"2026-08-05T14:57:12.882025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T14:57:12.885402Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.885402Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:6f47a936b5f3de48ea033c2401501a649d038c064a7ae0df266abbb518d96c39","observation_id":"486399a8-beeb-467e-bcff-766c87154cd1","resolution":{"observed_at":"2026-08-05T14:57:12.885402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-07T14:28:06.805424Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-05T14:57:12.889009Z","title":"Steering Llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.889009Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:f9cab47f83d87c7705869d99d00b2832891588d16042d67e465781ea3994cb89","observation_id":"acd42cd7-bdda-4659-9abe-4c29ecee0864","resolution":{"observed_at":"2026-08-05T14:57:12.889009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T14:57:12.892755Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.892755Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:7bd64cee0d8c461fb9e7c5edd92449cef240ac2ca13d307ce0655fd2f1eb7684","observation_id":"57a135cf-df8c-4683-85cc-9bd623cf73d4","resolution":{"observed_at":"2026-08-05T14:57:12.892755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T14:57:12.896258Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.896258Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:cf16d0498ce76d896771a4729ecffcf4d0245bbd1b1c21dbb4bf6baf94b57e4f","observation_id":"0671c2ed-033c-458b-b1c9-eae1ae50a15c","resolution":{"observed_at":"2026-08-05T14:57:12.896258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07667","last_updated":"2020-04-28T21:09:39Z","snapshot_observed_at":"2026-08-04T21:06:43.734460Z","submitted_at":"2020-04-16T14:02:50Z","title":"Null It Out: Guarding Protected Attributes by Iterative Nullspace Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07667","snapshot_observed_at":"2026-08-05T14:57:12.900075Z","title":"Null it out: Guarding protected attributes by iterative nullspace projection","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.900075Z"},"links":{"cited_paper":"/paper/2004.07667","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:7f57e3ea0762d4fdcc0b1f7f2153011b7f1b310485cc653f2c46e70c2389f700","observation_id":"2ea3a346-6727-4f0e-a0ac-fe9f4cf288e2","resolution":{"observed_at":"2026-08-05T14:57:12.900075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.903476Z","title":"An embarrassingly simple defense against llm abliteration attacks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.903476Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:d5a6b11df5a2cf101a15aeab5fe94238db8ab9603637ae679d2011e9d9cd2c5f","observation_id":"fec3c9fe-56bb-47cb-8083-252dbc476f9b","resolution":{"observed_at":"2026-08-05T14:57:12.903476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.906779Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.906779Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:cf78f7714f94817add16b66fd5bc93922db2a2fbb5faac6215d9a5c923e593af","observation_id":"97459c1a-bf2f-4334-9e57-cff5bdd29dd2","resolution":{"observed_at":"2026-08-05T14:57:12.906779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T14:57:12.911134Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.911134Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:eea645967f4385726941e4a21a48e5bd532e2f51961dafe8578aa2316c125bd7","observation_id":"d92c241b-2aba-4afe-b9b1-ae0890ac495e","resolution":{"observed_at":"2026-08-05T14:57:12.911134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.915277Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.915277Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:b293b08903c9e8706e3f3e9124615d01b7664381a9f6afe676d2567801d72046","observation_id":"bdda36b2-8d12-4090-9c2c-91c91c5d6d0d","resolution":{"observed_at":"2026-08-05T14:57:12.915277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02184","last_updated":"2024-10-03T03:58:03Z","snapshot_observed_at":"2026-07-06T19:26:43.399756Z","submitted_at":"2024-10-03T03:58:03Z","title":"CodeJudge: Evaluating Code Generation with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02184","snapshot_observed_at":"2026-08-05T14:57:12.918674Z","title":"Codejudge: Evaluating code generation with large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.918674Z"},"links":{"cited_paper":"/paper/2410.02184","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:4b0c56323ae12c3c478debcfef618ccbef8ac501641a9f87455e0590a37a65e2","observation_id":"99dd246e-57ef-45d8-b199-ff87eda4e38a","resolution":{"observed_at":"2026-08-05T14:57:12.918674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T14:57:12.922406Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.922406Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:3ba6581b73fe2b8af96bb769921a070c0a4f2d66d2a26e2ec69f8e3adb65d61b","observation_id":"8b876ede-e860-47df-a75a-7f728f26ebd3","resolution":{"observed_at":"2026-08-05T14:57:12.922406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-05T14:57:12.926010Z","title":"Activation addition: Steering language models without optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.926010Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:333995f558d7b04c5a516569b2fb9bb1b2821ce0caa25cbe015a0b946821c259","observation_id":"bab913e3-618f-44bc-8a36-de6a9893441d","resolution":{"observed_at":"2026-08-05T14:57:12.926010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09433","last_updated":"2024-08-15T19:51:07Z","snapshot_observed_at":"2026-07-06T16:48:16.671370Z","submitted_at":"2023-11-15T23:07:40Z","title":"Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09433","snapshot_observed_at":"2026-08-05T14:57:12.929314Z","title":"Trojan activation attack: Red-teaming large language models using activation steering for safety-alignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.929314Z"},"links":{"cited_paper":"/paper/2311.09433","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:0093ff15901cf3ba906dbcbc119ea73ccff75e14c09d4d7acb527eeba54c7b99","observation_id":"fdcaea98-406f-4a1e-8a4a-c9766de5394c","resolution":{"observed_at":"2026-08-05T14:57:12.929314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:13.807203Z","title":"Surgical, cheap, and flexible: Mitigating false refusal in language models via single vector ablation","venue":null,"work_id":"43d4e13b-c04c-4658-be6f-3eba098e65fe","year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.932659Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:9f388f3bdd69a3cd15ccca0860df0794eb318ab536ee9b75b7d97994979ee047","observation_id":"6f9949d7-4e83-4504-be8a-a821d8024bfc","resolution":{"observed_at":"2026-08-05T14:57:13.810919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-05T14:57:12.935639Z","title":"Jailbroken: How does llm safety training fail?, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.935639Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:11b6aea41e12a6306e2130c593173d111db27c8b337bdc3c6730ba924e978537","observation_id":"853dddd6-f99c-4b48-a081-8870c95abc88","resolution":{"observed_at":"2026-08-05T14:57:12.935639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05162","last_updated":"2024-10-24T19:21:52Z","snapshot_observed_at":"2026-08-02T21:32:36.729604Z","submitted_at":"2024-02-07T18:34:38Z","title":"Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05162","snapshot_observed_at":"2026-08-05T14:57:12.939155Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.939155Z"},"links":{"cited_paper":"/paper/2402.05162","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:f17d88bc5542a18b2fc7e4f2a4d741adbd8ed9ee5acfe6f338c7b7449d5187ae","observation_id":"83bd386f-8001-44d2-b4cf-dc27d23048cc","resolution":{"observed_at":"2026-08-05T14:57:12.939155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-05T14:57:12.942505Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.942505Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:b8f8749767d134d42597689cfcc36de80b217a34b891fd5e0481283ce324c8a7","observation_id":"b9ab188a-2c4f-45f4-b452-5e3f2a36c52b","resolution":{"observed_at":"2026-08-05T14:57:12.942505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18649","last_updated":"2024-02-28T19:00:12Z","snapshot_observed_at":"2026-07-06T17:37:05.339368Z","submitted_at":"2024-02-28T19:00:12Z","title":"A New Era in LLM Security: Exploring Security Concerns in Real-World LLM-based Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18649","snapshot_observed_at":"2026-08-05T14:57:12.945857Z","title":"A new era in llm security: Exploring security concerns in real-world llm-based systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.945857Z"},"links":{"cited_paper":"/paper/2402.18649","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:612dba18750b1753f2a19165777e3758a1cda960cd551636213ab394bad5cca3","observation_id":"55d8626b-c077-46ae-b78c-1ecdbeb34004","resolution":{"observed_at":"2026-08-05T14:57:12.945857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-07T11:20:01.991656Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-05T14:57:12.949136Z","title":"Shadow alignment: The ease of subverting safely-aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.949136Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:18a40fedd92819c576f5efdaf8150fc14493aafebec354301ed1ec3676a1a993","observation_id":"5599eacc-8ae3-4e23-9f71-3f74990be721","resolution":{"observed_at":"2026-08-05T14:57:12.949136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.952574Z","title":"Representation bending for large language model safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.952574Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:58749bed24d4985dd908d79f56abd39cd8062258228210a832d46bffb6fe3dc6","observation_id":"2e8c9d3c-aa7e-4eb7-9ed2-fbbabcde399c","resolution":{"observed_at":"2026-08-05T14:57:12.952574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20089","last_updated":"2025-03-20T15:28:18Z","snapshot_observed_at":"2026-08-07T05:14:57.199418Z","submitted_at":"2024-09-30T08:41:39Z","title":"Robust LLM safeguarding via refusal feature adversarial training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20089","snapshot_observed_at":"2026-08-05T14:57:12.955790Z","title":"Robust llm safeguarding via refusal feature adversarial training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.955790Z"},"links":{"cited_paper":"/paper/2409.20089","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:b9ac999ae014d277426237f74dd36b461b482e2b41c9bddc8d113e42b769e155","observation_id":"50435e64-1521-4101-838f-da39347e0c24","resolution":{"observed_at":"2026-08-05T14:57:12.955790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T14:57:12.959186Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.959186Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:a5a5181867cadf36712cf3c422987ceee7e00f586aa8a90346598fb9d0e0da10","observation_id":"6d65efbe-17ed-44bd-b2c3-53e3c656be66","resolution":{"observed_at":"2026-08-05T14:57:12.959186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-07-06T16:45:20.005195Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-05T14:57:12.962460Z","title":"Removing RLHF protections in GPT-4 via fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.962460Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:67698e0583f06eaec95b4769cf12c3d8cb5e4cd15156015448217005f0be2633","observation_id":"cee53ca1-667e-4e37-bb0f-bb69aa9df89f","resolution":{"observed_at":"2026-08-05T14:57:12.962460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.965956Z","title":"Adasteer: Your aligned llm is inherently an adaptive jailbreak defender","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.965956Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:be59eb7b15c3aa2dba598f83fcdb98b17d0b13157eff18f276006aeb76b0ab14","observation_id":"d37d7c29-99b8-41d1-a143-1a3e66ed316f","resolution":{"observed_at":"2026-08-05T14:57:12.965956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-05T14:57:12.969212Z","title":"Prompt-driven LLM safeguarding via directed representation optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.969212Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:19b4e19ab66487e030409cded6064012f5cf1833bb57ac445c0c7c8ac94405be","observation_id":"c96e3b12-54fb-4287-967a-e210244f832d","resolution":{"observed_at":"2026-08-05T14:57:12.969212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-05T14:57:12.972601Z","title":"Representation engineering: A top-down approach to AI transparency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.972601Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:57170519de66b321d7c207a03679cef1cc7849ce8529d776cd309994eb476736","observation_id":"bf27ccbb-f785-4237-bce1-f84d60fdb599","resolution":{"observed_at":"2026-08-05T14:57:12.972601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.976053Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.976053Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:503b14c4bb6c7fef6a5788f273419c110a7e95fe12bf766826b3e554b9ebca0c","observation_id":"2082d8e4-ab00-4930-86be-38c92635280c","resolution":{"observed_at":"2026-08-05T14:57:12.976053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.979904Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.979904Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:8274a4b490c57b31ff364c0038a9232ff77ebc415395f3de3a8c3161a1fd15a5","observation_id":"9341250d-b03c-4094-a3f2-8a4ebbbe4621","resolution":{"observed_at":"2026-08-05T14:57:12.979904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.983359Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.983359Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:7f974d3ea2a6e701fcbe5dcd6ce8f1b465112d8cf52da237b48b711f463a8bf0","observation_id":"47659d76-c0b0-4841-aa01-f10e23eebb01","resolution":{"observed_at":"2026-08-05T14:57:12.983359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:57:12.986775Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T14:57:12.986775Z"},"links":{"citing_paper":"/paper/2508.20766"},"observation_digest":"sha256:73a011f9513753a2d5c6edcfbbdec7d0d5e1fdd1f80b51ec662f878d8acc9d10","observation_id":"a1294e0a-e785-4981-bb46-198da192b190","resolution":{"observed_at":"2026-08-05T14:57:12.986775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.20766","last_updated":"2025-08-28T13:22:33Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:38:42.068471Z","submitted_at":"2025-08-28T13:22:33Z","title":"Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2508.20766."}