{"as_of":"2026-08-06T01:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4baddee50a923bc4be1ff1eb81b29c162283437510cf3dfe0bd3d797c001e7eb","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T09:27:01.450708Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.00572/citation-record","integrity":"/paper/2607.00572/integrity","json":"/paper/2607.00572/citation-record.json","paper":"/paper/2607.00572"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Universal and transferable adversarial attacks on aligned language models.arXiv preprint arXiv:2307.15043, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:c401b4fb583a73674b95cd299ea2c1fbb02f4419eda073fdf9ef6726240f05d5","observation_id":"349eceff-ca19-405d-aa13-ffafb802bfca","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:a9b19fe17a19b2910cc0af353ddaeb2f6abf8611ea36cd20b87f4a1a95625a03","observation_id":"83399b44-1fe2-4e2b-a775-713ea8e74fb3","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:52b44d8172b3aa363309528cdd225cc961f50d205d8c60cf63d6e0cbdf520411","observation_id":"a7c02e87-485a-499b-827d-2102c6ba037d","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:500205ac57d28ee92e017051c833cda9c86ce9cbabd3f495350ceb6a1bf9f7c7","observation_id":"a86ca43f-89bb-4fdd-99ab-12c410d5826e","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:5330f37fd0a9858cc58ddaa00eb6c59239145cb97947ce0eda47e1f53fc9a0c2","observation_id":"d52be77e-5c12-4aa2-97b3-005456893548","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Autodan-turbo: A lifelong agent for strategy self-exploration to jailbreak llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:cd0afeabc88dedf74cb958574c27c1347a2709f137078720af419040b7d6e793","observation_id":"a9c008a9-f87b-4c91-8d0a-f0075c9c134d","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Great, now write an article about that: The crescendo {Multi-Turn}{LLM} jailbreak attack","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:cbf629bd1334aca160c9dd372d71f74243ebda0093595ec56924886f3c1ce69d","observation_id":"48c0c71f-5a2f-41df-a541-20d2fb310765","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05367","last_updated":"2026-05-30T08:23:37Z","snapshot_observed_at":"2026-08-05T10:36:13.650340Z","submitted_at":"2025-09-04T05:53:20Z","title":"Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.05367","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Between a rock and a hard place: The tension between ethical reasoning and safety alignment in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2509.05367","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:7e42eecab46f573b5969ed8f143e3af81b7e1b49c7e2a90fe7dce510be6bb2fc","observation_id":"fa9d951a-6564-41a9-8275-953571c67020","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-04T19:12:56.970085Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Deepinception: Hypnotize large language model to be jailbreaker.arXiv preprint arXiv:2311.03191, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:08b99f3dc1e9e7ec423916e6d1e302188b6eba671d9793cc11268bc804101671","observation_id":"27503855-02e2-46ec-97d3-38ae4b05ea29","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Codeat- tack: Revealing safety generalization challenges of large language models via code completion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:3c1af8b0ab10451e341882046d6e74cd3fc7fd7d5303defd83421db4423aa33c","observation_id":"665009a6-5061-498d-a52f-7cd49a0425e8","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Artprompt: Ascii art-based jailbreak attacks against aligned llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:7884f41c5ea286fb29231c1ade3a0d252ecb9db73aa1541a7bee80c85223934c","observation_id":"ea688beb-b2cf-4c88-aa9b-b9d278dcf0f6","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:8fd8080349ae84a809fe813fdcd501fc883c0fc4e9668f667c2352f4c7b4b327","observation_id":"fae2c09a-a602-46be-bd55-397322efeb11","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:f9ec57e7e3cb1fff8c7e55d9ff251314c0a0be7aeaf36cbf6fb26dcbbb2ec771","observation_id":"fcbf4ab3-a4f7-4c57-bc73-1e290657cd6d","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:7f8af86a13f66461f8bfaffff0c149cab95d5648b06b4d4d82ab65f27562cb31","observation_id":"4e9cd261-1492-4741-89cd-51dca90a7c5c","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-07-06T20:11:15.503499Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint arXiv:2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:5a02788bb1b4a9de7f60ee80500b4964dece5483cbdeea3189e617aa18b55fd4","observation_id":"9b2a054d-3b7f-4ee8-bccf-a3d47cd92f47","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Stair: Improving safety alignment with introspective reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:48cf77c7e3c69c26564e7db908435ffd3a3ef26420c82f8dc6ea7c04324b6f82","observation_id":"f97bc49c-dcea-4f65-b036-863b21157e77","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Programming refusal with conditional activation steering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:3e766e34583336b89ba23538754c6b98a0ccd75df544f61e7659ee13521fa20f","observation_id":"1898b460-1e07-49ad-ab28-1f57da9c091d","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Scans: Mitigating the exaggerated safety for llms via safety-conscious activation steering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:8e01a9bf0b4650cc86afe7e9342a8d24741663c7f4eaa7e8a111f1f573c592ac","observation_id":"26dcd498-52c9-4db3-9679-28eed5c8992a","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Improving alignment and robustness with circuit breakers.Adv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:f87209c465d0a9c3a84c2e5486c2c4d47be42e458e914518139fb49184e2ae44","observation_id":"e245bf66-3f2e-4b02-be2f-fe1f6ccfedad","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Representation bending for large language model safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:cb1e064a9e4d8ef2f8794dd3bbdd66a1de6ad4a3af52e613decdf349ee36aa92","observation_id":"da09daaf-fbf6-4b19-ad51-06eacd8e58b4","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-04T06:04:31.063310Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Latent adver- sarial training improves robustness to persistent harmful behaviors in llms.arXiv preprint arXiv:2407.15549, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:9785d7ebe8ff363ca372582c7d748a15c792b71c47211e9bce62a5a9b6171d8f","observation_id":"69947b70-976f-4ec3-a387-7733c7d15841","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"On effects of steering latent representation for large language model unlearning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:27ad86ad21a3210a33a8a19a815823d54fd1ec049934b4529b9eb6f960bf294e","observation_id":"6606df10-e0a1-48af-8020-804716d7ad8c","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:5a2cfc47cfac68fae9cfeeb5fda18c78a49a45e12f233dcdb92d59716f72fcea","observation_id":"078b703f-4dfe-407c-bbe7-825e0c504931","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Llms encode harmful- ness and refusal separately","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:5866dac64f61baf4ac80cf21136393dd14d2fa341b02d6ad24847cb4f747dcbb","observation_id":"e793413e-b877-4bfc-9e75-3620df25a06c","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"A general language assistant as a laboratory for alignment.arXiv preprint arXiv:2112.00861, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:0cc8244d2bddcc215a968a911a46e03695cf9acc0e8dda611f530364686e540c","observation_id":"36b37914-aac6-40b3-aa41-472a20e869dc","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Training language models to follow instructions with human feedback.Adv","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:2292bd7c233772e9947d5a6f55e7d45eb6234e56fecb410c12b178bd4519952f","observation_id":"65e3f1af-fcd8-4bca-8f13-4967d973802a","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:14f6125c9dd3553ac9d4c8c4ee4fb1041a21788555e1c6123fd099541d4d9f17","observation_id":"b422ab98-86f6-430e-9a1e-cf1a63729379","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"The linear representation hypothesis and the geometry of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:f401ca015c92d26477d86143bb1940fa80b4351356f82d0d9c001b20838cfb84","observation_id":"23f19ad7-6ff3-4f1a-800f-6944d36c0655","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Toy models of superposition.arXiv preprint arXiv:2209.10652, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:2531fa428a2a3feff13e01c0df4900ce51a27a1b41928893a5038156229b400b","observation_id":"8a28ed0d-bcd1-4e43-bd1d-4c3acac9bcd5","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets.arXiv preprint arXiv:2310.06824, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:c256f4feef57acdb31732d98875f70cf8cbc7efc54c1328de6e5edc967d6bf6e","observation_id":"a5c35159-4181-46cc-8221-aa26a3fc1e6e","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Steering language models with activation engineering.arXiv preprint arXiv:2308.10248, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:0b617c3b73d2d1d68e81c641a39884b54e6ba77fee3517e40bfb7beda75f205a","observation_id":"988a7bfb-2af5-4d0b-bc63-b444476738aa","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Steering llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:d9e5918e531f223f0f870ab83d8a5196148e7bde840cb2d3d9d0b4a13e801159","observation_id":"2eb021f2-0ce7-49cf-9dcc-8bec0cc05b89","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Representation engineering: A top-down approach to ai transparency.arXiv preprint arXiv:2310.01405, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:937d8714e72b3f04201b712c4abfeaaa7e0c326e1a65232215c00ca6d379e4c1","observation_id":"1e2e8620-f2eb-4eb7-9026-0d533a6933fb","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Diff-in-means concept editing is worst-case optimal, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:04ba3daf7f25d1a1345f87a6f8c8f64587d88f4e8f7776a12cb8ddeda83acda0","observation_id":"75ba58ae-c9bb-4bad-b3b7-487290664f63","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Inference- time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:b682d24a0ccba247fca95d003e0e3e9e969e4befc6d2920bc59c496f4aef9808","observation_id":"de6ecb4a-7d27-4aaf-8d1f-08588c88b3b9","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15154","last_updated":"2023-10-23T17:55:31Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:55:31Z","title":"Linear Representations of Sentiment in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15154","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Linear representations of sentiment in large language models.arXiv preprint arXiv:2310.15154, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2310.15154","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:49b9d0e04acd21d7a86cea44d35a5dfcd853ab7e59071264a98e8019a21e2ffd","observation_id":"b698df7a-9a0e-435c-9eef-6052af0a0baf","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Improving instruction-following in language models through activation steering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:e7a0805988c592004d2c1e74b278698d425c7a5cf8b5fb207940e13c778382ab","observation_id":"6125dd17-9811-4507-8f75-bbc056b69bf1","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:c7e82eb3f9754850f4895e62e522fb7bfe9cc4e523f992cc6bf175853dca5329","observation_id":"c21c4caa-636d-4332-a5a8-6ecce864516d","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Qwen2.5 technical report.arxiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:bcfa60cbf6d89e3fdcfaf1943889b98c105d456367e31e81ab0c8da19ee27d99","observation_id":"64110347-6aae-4c8a-b8f4-7b8c2a8a66f5","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Openai usage policies, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:d698e60e8c17926f7ca55e60121f9ee3b02dd13f9c9367f4402090e7ec140baa","observation_id":"7289d67b-a329-457a-893c-5d740e857a7b","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Exponential moving average of weights in deep learning: Dynamics and benefits.Transactions on Machine Learning Research Journal, pages 1–27, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:acf0499aa0ddc8407eef4e1461376a8acd1bf3612c962686c6b4dd6744d01b36","observation_id":"e191348a-b2f8-4bd7-bdb3-0a45f027740a","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Rethinking safety in llm fine-tuning: An optimization perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:483369a5b70b9493b378b0ffcf8ab7407f75215f444fb3ac8ee45815661d0de2","observation_id":"76b4bd4e-5dbd-4b83-9d5f-248055b13a35","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Pku-saferlhf: Towards multi-level safety alignment for llms with human preference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:b43b25eb74b0046670fbe08ecf92c4c304b8073513bf23d46ac567505798f0b0","observation_id":"083bb1af-6660-4453-9fa6-0bbf76522683","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In Int","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:4b2c6c69ffb29741c8c3eced5098ad5ca1233eb53e362fb8f429f4842058e3fe","observation_id":"7a30b095-c8e2-4179-b04e-af8f77ee6e08","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:a874fd6c1a148b7736d4215d39b05fc315a17d7abc2960aa84dcb07e4c7f781d","observation_id":"298806c9-ec88-44af-8b06-47b6f0d355ed","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:cc7e1e388ceffb9073bd874a73d5567b4cdac72c2952aa9a483363e11b4ac114","observation_id":"0feb2e48-1960-44fa-9fad-a01c7c9339c7","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"The art of saying no: Contextual noncompliance in language models.Adv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:5348b059222f7c4ea0efe166b98125cf3db7ce00712902e986a51d98d9132d54","observation_id":"8801fbff-ae13-430a-bc7a-d0c566d08dc7","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Measuring massive multitask language understanding.Int","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:4d7ff4fca7c8c4d203131028f3366c94d989ed649ec767d62c4741ccb6d87b66","observation_id":"04cb9ba6-c668-4086-b1b6-3c0247e3698d","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Aligning ai with shared human values.Int","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:0282f66392d504d144a9fb068b9331fc735b59f8377b37d2a259a7ddee2a6dbd","observation_id":"7237b0be-5ba8-4f9a-ad04-8726142e9cdd","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:b586ee0d549582f044fbcf24dedbbd2d8e26c1a1a452033b4268456ce7d2b540","observation_id":"f100205f-c54d-45f2-abf2-dac03049f1c9","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:ef416aff9104528bbb8e0be01e337ce1ea3b94070862961059a3bd2553b0fa81","observation_id":"e1ffa12d-b3e4-454e-b6e2-0275d27b11e5","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:357e5d6fbd805cada04b56b0063d37e5576367a1414062f5d8ec59678c145bd9","observation_id":"105ac1ae-c33a-4b8f-af3a-49a46010d14f","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Mt-bench-101: A fine-grained benchmark for evaluating large language models in multi-turn dialogues","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:12c8532daa3dbdab4f7236460e4767d36699a18a61b5bcc3a9361f87b869bf1e","observation_id":"7bd5f164-e71b-4a1f-8e1a-5c9d263a7c05","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"A survey on llm-as-a-judge.The Innovation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:658a373f3bde49764704475f59be70fc42ba3ab603428285dd141f334bccf40f","observation_id":"8279766b-24ed-4974-8501-084773785cde","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:9ece8235cb3b261813cbed83d8a1fa47a41554664d995d52b00d24cd0ba9fcd2","observation_id":"4baf2020-c1ff-44de-a9a4-125e91f9dda5","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"The geometry of refusal in large language models: Concept cones and representational independence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:5a13f09c3812f954aad04554ceb7ccb39f27242c8f687715159e42fe2956b274","observation_id":"35aaa368-611b-4f4d-b352-875ea2acc8c4","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"The hidden dimensions of llm alignment: A multi-dimensional analysis of orthogonal safety directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:cd95cadf6100c652249616cb17f8fe4813434b24a304f04b77b0cef050b960ec","observation_id":"49bf8d41-7f30-4c56-9767-48ea2811a35d","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Differentiated directional intervention: A framework for evading llm safety alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:a31a077cbf919aa897f5f1461cf8dc02a7ee2ffcc040512984c8ed608f93101e","observation_id":"880abd99-68a2-464a-8c35-fa7ee0f4eac0","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Alphasteer: Learning refusal steering with principled null-space constraint.arXiv preprint arXiv:2506.07022, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:d27c9459bd584462ca60b97a26d08e4be76b1aef2df61bddd59c6f3db90dee1c","observation_id":"7ccba616-4e61-476c-91b7-fff80981294a","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Analysing the generalisation and reliability of steering vectors.Adv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:55d703f28053cbcc2d170a5472c90a02e0458789dee9fc52788c7e3251b4539e","observation_id":"f63c3331-8162-426c-b48a-a1485a18b73f","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Or-bench: An over-refusal benchmark for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:906704cb14af25a2d4cb16b8f326d14a413a5f4d8f3abe8a7f17a4fdb018ac24","observation_id":"ca3310b1-0b6d-451e-abe6-b2f66f4e3822","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Universal jailbreak suffixes are strong attention hijackers.arXiv preprint arXiv:2506.12880, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:65a59687e252931fc67706e49f11611ca8bd6931fa640c8b50911d844c7f3fc7","observation_id":"1df60ea9-085c-4ab9-ac56-e71a3fed136b","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Flipattack: Jailbreak llms via flipping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:d43b411093999a1171ea9ef4997968ea8d3c0a4a625d53df837975daf0bceda3","observation_id":"59596b0f-d842-424f-b74b-4dcfe998b6f0","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Many-shot jailbreaking.Adv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:f65fcb8733595e75fefd40e86788c402b0b8d366369b2611995d163d9cfc90d3","observation_id":"0f580215-e422-4885-814f-b6f6f14c63da","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:829450100d6753ec504dce58faa19b9f6859f3921ccd3ae7680cde401624125a","observation_id":"458ee6af-9556-4d03-adde-58a99e8babef","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:9c4a00b102d8839e6feaa380866550e44c472b986d4d9ab23f01519f5ceeefa5","observation_id":"8a05a620-e575-4fd3-ade9-1f907754593e","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:ad90bc0a0e139b547de27e3bae568c3a34875b144d9dd92206c8717f9c0bdf12","observation_id":"61529521-92bb-4218-9808-e8fc093a1ff6","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:2c227a57e98ce146ce54087821d8aefe4373658ed56c2c8da0c9bdcf4cea3423","observation_id":"5fb6a24c-dd3c-430d-b446-7173d7548168","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:c76f35693d74e4c905096ce19a70074304f5e5a9e95b99ee8a9dd22f0a70f35e","observation_id":"81f9127c-41b8-409a-860e-f2d783815fdb","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms.Adv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:abd86726e5fbaa185e8653ea6ba9d92420150d5daa97044402590d879ac63b37","observation_id":"449b96a0-5286-48ee-b5e9-afdf06f6be8c","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"What are some good books on Roman history?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:0e8c6bcdc3a1b42d16deaf8f7cdd234700aabe58626dea77f2c30bd92b4894bf","observation_id":"14ec44a6-e41e-41b4-a96a-f41ba9dac89b","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2607.00572."}