{"as_of":"2026-08-05T11:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b2e62ffc2a99a63c5a8f77678bf79bca73ec095ae5a5dcd2e1feb7f5a7d704c","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T13:51:23.302296Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T03:49:26.207330Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T17:48:45.643373Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2606.16349","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.16349","snapshot_observed_at":"2026-07-03T17:48:45.643373Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","venue":"cs.CR","work_id":"5083fa16-54f9-43ad-b685-107b06af3a8e","year":2026},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T03:49:26.207330Z"},"links":{"cited_paper":"/paper/2606.16349","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:50c46ab5d563a1fa535b88dc824a50ab5fd4823ab6b6e2a3597e1f2811dd777c","observation_id":"14ccfa8d-37c3-4791-9edb-ab9fd7655f5b","resolution":{"observed_at":"2026-07-03T17:48:45.644591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.16349/citation-record","integrity":"/paper/2606.16349/integrity","json":"/paper/2606.16349/citation-record.json","paper":"/paper/2606.16349"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"HarmBench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:e235f177e28135652b541443fa94e1af7919342478705ac1789461e39af09d3d","observation_id":"517d5d7e-7b84-4ede-8b16-100604b4c251","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"A StrongREJECT for empty jailbreaks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:3f832927d8143cfb6717cab9a29fe46a441b8457355dc7bda79f7b7f0b6a80a4","observation_id":"234f4c65-ad39-4d23-8f51-4d524fa98b6e","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"XSTest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:0f4e928b7373c554aefe05d95f205fb830f5ec5cdafa4b2b5e7d643e56448907","observation_id":"6a38767c-91b1-4561-8dd9-908e50a71823","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Refusal in language models is mediated by a single direction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:db164baf0bd49eb7a053ca02f7bad75a66bf800c317b3108e73a683e29583554","observation_id":"527a698d-9823-42b4-b34a-ec034aa2c4a9","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"COSMIC: Generalized refusal direction identification in LLM activations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:6e5cd7f20b17120a2610219cd6b7e0e42badb93bed5f7c9a0d1d8b1a3b7f2a99","observation_id":"be8d6c9d-66d7-4b68-97db-4c7a5048161f","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"The geometry of refusal in large language models: Concept cones and representational independence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:9c90d8e573f1c8d2cc2cb2935c1884a6e564b94d490c52ea16933eb5029cc8af","observation_id":"93059131-1573-4f46-a876-7574380d2a42","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"LLMs Encode Harmfulness and Refusal Separately","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:b81557c49fd2b86162c44d4d9c285e6c2ffa89e64a264531b679dd5a90f574e5","observation_id":"636a9cab-1665-43fb-8dc6-08fbbfa9c357","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:79e6f73545a3377cf774307bb513cf793b7f0c94fb5f7184ed21f0f67b7d486f","observation_id":"ae90c5f3-a7c3-4594-99da-f9279fa17980","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:28b646d9b4085ee2334e52c851f69add0827341b97d28a14411243f0b70c4303","observation_id":"40fa5604-5615-4480-9470-40ae5d26cfdc","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:7637fed629f528a5a8833be95be14e179353d14f42571ad6f680153caab36d4f","observation_id":"1e1eecbd-f3c3-42cb-afcf-30d735cf7307","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:942cb70a17d84983a6ca0f1281fab9a563524dade42208975044f9d9e29224b3","observation_id":"98964eaa-527d-488b-af0a-de80dd4ca404","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"AutoDAN: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:269dcf0b1b22d0e3baa50622c9db348a0e3ad1f34f9c136df5ea3f432d070e80","observation_id":"b8461ac4-f350-46b6-98da-e48874fea09f","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27019","last_updated":"2026-05-25T19:43:08Z","snapshot_observed_at":"2026-07-06T23:12:33.898150Z","submitted_at":"2026-04-29T12:44:05Z","title":"Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27019","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Dynamic adversarial fine-tuning reorganizes refusal geometry","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2604.27019","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:1f53f51d30eb9db81ca9efa2e6f57cdb825244397256b790fd4f976a631425bb","observation_id":"cdcb5004-6bae-45ef-abc4-c524fdf095c2","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Pappas, Florian Tramèr, Hamed Hassani, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:854a6d8ba2d61850a15e49f59cae37529c399694d897fe7fda55af42919e869d","observation_id":"8d8693e8-7b69-4405-aedc-5acd64c57409","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"OR-Bench: An over-refusal benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:03a9bc61c7adb98cf199a9bc01238bb346681951019c23b50754b110c28e58d5","observation_id":"8e0ad023-5950-4a2d-9d13-8aaed034aadb","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08054","last_updated":"2025-07-15T10:03:15Z","snapshot_observed_at":"2026-07-06T21:22:55.485833Z","submitted_at":"2025-05-12T20:45:25Z","title":"FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08054","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2505.08054","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:38635ee14a41a39078300fbe12e870ab468a0f260c48c819d9b19097d4dba7bc","observation_id":"8cab7028-1ce8-4184-851a-58c7fd8e3341","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:ff8493255fd903f4ae8fc5801361e3fc3e81504863710d57e60b6f06e786bb1a","observation_id":"8799d1f8-ce76-45b6-b232-40e028ce072e","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In��� ������� ������������� ���������� �� �������� ���������������, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:8d32d6e64e7261d54555a075c851a4679a13677b60e9459e93a80dfbab6f3122","observation_id":"6b59134e-298a-4831-a814-00e79c71256f","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Robust LLM safeguarding via refusal feature adversarial training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:5c5dbe58e01608835a03a8fea4f4e25893f19f5e1a6b8c29ca455b29c1724052","observation_id":"e10e4143-9f50-4b2e-ab0d-b8dd5087b1b4","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05030","last_updated":"2025-07-29T09:44:14Z","snapshot_observed_at":"2026-07-06T17:41:23.460300Z","submitted_at":"2024-03-08T04:22:48Z","title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05030","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Defending against unforeseen failure modes with latent adversarial training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2403.05030","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:db48dd4e8aedf8620373d4064a803ea03ff4bcba19caa4984fcb8428994d9a47","observation_id":"e78c5e00-dff5-44fe-a5e2-8bc5177ceb23","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-04T06:04:31.063310Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Latent adversarial training improves robustness to persistent harmful behaviors in LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:51ec394944b89b160b5f31e6621c4e0466435566d012de96a8b7c2739be45b8f","observation_id":"de712837-19de-409e-9cab-cc3856103e18","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06795","last_updated":"2025-09-08T15:24:33Z","snapshot_observed_at":"2026-08-04T23:10:17.174121Z","submitted_at":"2025-09-08T15:24:33Z","title":"Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06795","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Anchoring refusal direction: Mitigating safety risks in tuning via projection constraint","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2509.06795","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:d4871c9ca4ecbc54a7aba4b76c97b7fe6b9269d3c58ac17ae296f270f8c7b441","observation_id":"8bddd9a4-b930-4113-9a99-5134a473fb5c","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":null,"venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:cd37c48bd52e4d62e5647238c0b8b64c2bab1f148f70eac83d0205fc8d6ef5f1","observation_id":"f23cf5d4-accd-4444-9ee9-b58ff2c50178","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:114e5683ce24f37763665ff8b7573e1a7574f8eb32cea1157412ef904ed60f12","observation_id":"b02d906c-690a-4dc7-9b00-247d2fd9d436","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-07-06T16:56:46.051958Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-07-12T13:51:23.302296Z","title":"Tree of attacks: Jailbreaking black-box LLMs automatically","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T13:51:23.302296Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2606.16349"},"observation_digest":"sha256:13d7151e158ddbac995523d9d34ebb097dde1c41f98798bb964948de4022f54e","observation_id":"149c929f-a39f-4043-9ba9-933d92b01a9b","resolution":{"observed_at":"2026-07-12T13:51:23.302296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.16349","last_updated":"2026-07-06T07:55:59Z","latest_version":3,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-04T03:14:52.240012Z","submitted_at":"2026-06-15T07:50:00Z","title":"From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2606.16349."}