{"as_of":"2026-08-08T23:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:939eb8ce12687240ba68fbb2319c517fd9c1f1bbac3a32a997b055827e0bdfd0","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:32:06.668110Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28959/citation-record","integrity":"/paper/2607.28959/integrity","json":"/paper/2607.28959/citation-record.json","paper":"/paper/2607.28959"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:06.533912Z","title":"B Additional Results B.1 More Results Table 5: Additional cross-dataset robustness results on Pythia-1.4B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:06.533912Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:f8f7a6ec7f33b6267ab127e157d933e40957260d3164bd7679084a24336a3e48","observation_id":"2551cf87-a5b1-4484-a124-3b114d97f47c","resolution":{"observed_at":"2026-08-03T16:32:06.533912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:03.762556Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:03.762556Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:95260ddaec2f62d425cb5553f053870ea1746d2a119f709dc5d15f0a1e011fcb","observation_id":"3296c2b7-700a-42d3-b72a-66524f9d805d","resolution":{"observed_at":"2026-08-03T16:32:03.762556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17806","last_updated":"2024-07-15T12:07:09Z","snapshot_observed_at":"2026-07-06T17:51:24.261505Z","submitted_at":"2024-03-26T15:44:58Z","title":"Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17806","snapshot_observed_at":"2026-08-03T16:32:03.929481Z","title":"Have faith in faithfulness: Going beyond circuit overlap when finding model mechanisms.arXiv preprint arXiv:2403.17806,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:03.929481Z"},"links":{"cited_paper":"/paper/2403.17806","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:2d6977ea7fd54098334aa5bd502f1f1e2c921da4e09a328e0a7f3b1ab7d936aa","observation_id":"ab517157-5720-4a3c-b2b4-cab81dd2413f","resolution":{"observed_at":"2026-08-03T16:32:03.929481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:04.041299Z","title":"Impact of positional encoding: Clean and adversarial rademacher complexity for transformers under in-context regression.arXiv preprint arXiv:2512.09275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.041299Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:bd11694e1ead1780c2f7265fdd595aa26c261a33afc4f6cd1cee3de691c147d2","observation_id":"3dcae857-56cf-4d3b-b6a1-080cb97ec7d4","resolution":{"observed_at":"2026-08-03T16:32:04.041299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18213","last_updated":"2025-06-05T08:11:43Z","snapshot_observed_at":"2026-08-06T20:29:52.745778Z","submitted_at":"2024-07-25T17:26:41Z","title":"Scaling Trends in Language Model Robustness","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18213","snapshot_observed_at":"2026-08-03T16:32:04.086998Z","title":"Scaling trends in language model robustness.arXiv preprint arXiv:2407.18213,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.086998Z"},"links":{"cited_paper":"/paper/2407.18213","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:feaf1c825a5dc0285471fbc9ee633aee7ed9cb41c7fc32888c151b6c40feb0de","observation_id":"09b5869f-2af2-4ec9-b95d-8a3193b6c1b5","resolution":{"observed_at":"2026-08-03T16:32:04.086998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-03T16:32:04.155055Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.155055Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:b412613c7f4265cbf9ee6276809b098a89c277171cb7e0afa344bd22cadf87d0","observation_id":"848ec80b-7426-4632-bcef-803bd1d40a29","resolution":{"observed_at":"2026-08-03T16:32:04.155055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01967","last_updated":"2024-01-03T20:26:15Z","snapshot_observed_at":"2026-08-06T16:33:15.793419Z","submitted_at":"2024-01-03T20:26:15Z","title":"A Mechanistic Understanding of Alignment Algorithms: A Case Study on DPO and Toxicity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01967","snapshot_observed_at":"2026-08-03T16:32:04.215688Z","title":"A mechanistic understanding of alignment algorithms: A case study on dpo and toxicity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.215688Z"},"links":{"cited_paper":"/paper/2401.01967","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:e6561f3450efcdfae756191e42967846fa6088d9fb5edc538b17239df5a6defb","observation_id":"365eb461-c285-4511-9f18-379cb93a83d8","resolution":{"observed_at":"2026-08-03T16:32:04.215688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:04.296886Z","title":"Towards understanding jailbreak attacks in llms: A representation space analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.296886Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:3bdf1b386c5add324ab99dedbafa3d5ebf4cd6c39dc12686c1cb02314028cace","observation_id":"613df603-5f04-4fa7-96fe-b57127c83eb5","resolution":{"observed_at":"2026-08-03T16:32:04.296886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:05.190586Z","title":"Alignment-constrained dynamic pruning for llms: Identifying and preserving alignment-critical circuits.arXiv preprint arXiv:2511.07482,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.190586Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:cdacd347cf07619d7ea6fbcb5b8e90d52c4845bb92eacf2fb3f9fe2e81caef17","observation_id":"2f6c4c26-d4e2-410a-a026-854060ed12bf","resolution":{"observed_at":"2026-08-03T16:32:05.190586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:05.263234Z","title":"Attention sinks and compression valleys in llms are two sides of the same coin.arXiv preprint arXiv:2510.06477,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.263234Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:0546565f6fcb0f87e82b5ba0857acca288a24778f27515acfc3b633011453110","observation_id":"86cc0165-c5b4-41c8-9ded-d4cba665f6ca","resolution":{"observed_at":"2026-08-03T16:32:05.263234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:05.352575Z","title":"A general framework to enhance fine-tuning-based llm unlearning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.352575Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:1d4641acb642c3c2f9d450447a410ac52a6ed87478d1ecf81fc71229f1d06b8a","observation_id":"8db00739-e0ec-4a77-90a9-3e8c425eda61","resolution":{"observed_at":"2026-08-03T16:32:05.352575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-03T16:32:05.426090Z","title":"Open problems in mechanistic interpretability.arXiv preprint arXiv:2501.16496,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.426090Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:2d0b698e258e64aeea5f99d32926dd1e62d0ab8fed3c3ea4d2146aaee02e7964","observation_id":"d02be9e3-24d2-422e-8a95-88d5772d846a","resolution":{"observed_at":"2026-08-03T16:32:05.426090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-06T22:31:48.025702Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-03T16:32:05.505938Z","title":"Latent adversarial training improves robustness to persistent harmful behaviors in llms.arXiv preprint arXiv:2407.15549,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.505938Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:7d1bbb421d54e0ad63adfeedeb2421b66d0b21867bc12832cab6e312f37d1c8a","observation_id":"a8291210-311e-4da8-86bc-6484b77d4e1e","resolution":{"observed_at":"2026-08-03T16:32:05.505938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-01T16:50:50.645857Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-08-03T16:32:05.577174Z","title":"Layer by layer: Uncovering hidden representations in language models.arXiv preprint arXiv:2502.02013,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.577174Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:5580c0418a98e63295ee90e6a1a3cc0b68193144ec485d55ca3a2d6c56b393e3","observation_id":"fb6ffc55-2fdb-4cc1-b425-57bc77fd86ea","resolution":{"observed_at":"2026-08-03T16:32:05.577174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01011","last_updated":"2023-11-02T06:13:36Z","snapshot_observed_at":"2026-07-06T16:42:04.139453Z","submitted_at":"2023-11-02T06:13:36Z","title":"Tensor Trust: Interpretable Prompt Injection Attacks from an Online Game","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01011","snapshot_observed_at":"2026-08-03T16:32:05.653882Z","title":"Tensor trust: Interpretable prompt injection attacks from an online game.arXiv preprint arXiv:2311.01011,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.653882Z"},"links":{"cited_paper":"/paper/2311.01011","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:c4a58a6b9c6bf1649999d090ed4364b3c312fd546c3d641549be3e2b9909ec13","observation_id":"2b339f4c-fdf9-465f-bbfb-7c52b605216c","resolution":{"observed_at":"2026-08-03T16:32:05.653882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-03T16:32:05.729882Z","title":"Steering language models with activation engineering.arXiv preprint arXiv:2308.10248,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.729882Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:5344823ec6ec28c6cd98118976dd23bb570b78b79f2b0842660b8b821a7c8fb2","observation_id":"4c8dac68-8c8c-4713-8032-17643f6529db","resolution":{"observed_at":"2026-08-03T16:32:05.729882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-03T16:32:05.802460Z","title":"Inter- pretability in the wild: a circuit for indirect object identification in gpt-2 small.arXiv preprint arXiv:2211.00593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.802460Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:03ed0538bdd7e2c97409b290c14213d6af72d681e5b05a99152d6e3c868be3ae","observation_id":"b46aaab2-d5e1-44f5-83a5-5aed2fab45e8","resolution":{"observed_at":"2026-08-03T16:32:05.802460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.03994","last_updated":"2020-01-12T20:30:22Z","snapshot_observed_at":"2026-07-06T08:49:58.983987Z","submitted_at":"2020-01-12T20:30:22Z","title":"Fast is better than free: Revisiting adversarial training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.03994","snapshot_observed_at":"2026-08-03T16:32:05.877768Z","title":"Fast is better than free: Revisiting adversarial training","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.877768Z"},"links":{"cited_paper":"/paper/2001.03994","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:9bb582af44be85b08cc6c2c5cf3d52f8fa32d1897a53159aef23516048ca9aca","observation_id":"d34c49ad-2ba7-4c9d-b8f7-0132ba070559","resolution":{"observed_at":"2026-08-03T16:32:05.877768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T16:32:05.969389Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.969389Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:cb5b2711bd95372fc02b5d062a0be1c5a5b257ae86fde68efbb6e0bc39b71d3a","observation_id":"35456b1c-74db-4559-a505-52e9e6749cf2","resolution":{"observed_at":"2026-08-03T16:32:05.969389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-03T16:32:06.059462Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts.arXiv preprint arXiv:2309.10253,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:06.059462Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:c10bd038696c5b8eebd751cec6ccf63a5b25c7924ae3107e14038f72dfe7dfbf","observation_id":"cf703032-cc22-4496-aa42-6183a8021c9c","resolution":{"observed_at":"2026-08-03T16:32:06.059462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15042","last_updated":"2024-10-19T08:57:35Z","snapshot_observed_at":"2026-07-06T19:36:23.905725Z","submitted_at":"2024-10-19T08:57:35Z","title":"Adversarial Training: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15042","snapshot_observed_at":"2026-08-03T16:32:06.164646Z","title":"Adversarial training: A survey.arXiv preprint arXiv:2410.15042,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:06.164646Z"},"links":{"cited_paper":"/paper/2410.15042","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:5e8ed045707286e26067fb4dc048165343b1fa5406b23845fb10bbd482b8509b","observation_id":"ad144c06-cf9a-4a3f-bdb6-68b24ef6127c","resolution":{"observed_at":"2026-08-03T16:32:06.164646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-07-06T17:23:14.388964Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-03T16:32:06.278220Z","title":"Prompt-driven llm safeguarding via directed representation optimization.arXiv preprint arXiv:2401.18018, 3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:06.278220Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:a37c04f2226e995f6ad793a2478b28a9e7419b0b06e582085a9501ae30e82934","observation_id":"7b1d80d9-b084-414a-9a8f-51ecc7ee23d1","resolution":{"observed_at":"2026-08-03T16:32:06.278220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-03T16:32:06.408696Z","title":"Representation engineering: A top-down approach to ai transparency.arXiv preprint arXiv:2310.01405, 2023a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:06.408696Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:35709169ed2c709fde66ba60d1a7261d88758ede71300401dd707177e384d952","observation_id":"dc43658d-ade5-4f40-ac50-deb247ede3c3","resolution":{"observed_at":"2026-08-03T16:32:06.408696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:06.668110Z","title":"Hence ∥(I−P S)rt∥ ≤1 m0 Mt","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:06.668110Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:abff39291243c520d15e2aadd74548053b42f085959850290226ad8c271d5fba","observation_id":"0e9accf4-b6e4-42d9-80ee-6f69908a6df3","resolution":{"observed_at":"2026-08-03T16:32:06.668110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06440","last_updated":"2017-06-08T19:53:26Z","snapshot_observed_at":"2026-08-07T07:29:29.524604Z","submitted_at":"2016-11-19T22:48:30Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.06440","snapshot_observed_at":"2026-08-03T16:32:04.848482Z","title":"Pruning convolutional neural networks for resource efficient inference.arXiv preprint arXiv:1611.06440,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.848482Z"},"links":{"cited_paper":"/paper/1611.06440","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:8b1d8c0dd968f79d56a91797a7360c78f4473482ad67c126bdb03403d87df99e","observation_id":"7f9d2b97-93d2-4982-bbd5-09161d5f1032","resolution":{"observed_at":"2026-08-03T16:32:04.848482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-03T16:32:04.443242Z","title":"Towards deep learning models resistant to adversarial attacks.arXiv preprint arXiv:1706.06083,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.443242Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:fe3b3a51665d81f0e88c472301b5e86b10b593968add3c01b65ca08c1f875bcd","observation_id":"55167202-7ded-402f-a8cb-7e661079240d","resolution":{"observed_at":"2026-08-03T16:32:04.443242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-03T16:32:04.612787Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets.arXiv preprint arXiv:2310.06824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.612787Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:4edfde20dd1a63c291e8c44732b1a61331e85e7a4e708e34a3f2f2af646f1ecb","observation_id":"43a7b00d-903e-46e1-96cd-43356c8c70fb","resolution":{"observed_at":"2026-08-03T16:32:04.612787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:05.019151Z","title":"Softmax is 1/2-lipschitz: A tight bound across all ℓp norms.arXiv preprint arXiv:2510.23012,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:05.019151Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:f9c49b42d8f9a3b798f9933a2392bb0ada081971035e714fb68829807330641d","observation_id":"64ff00e6-bf42-4af4-a79f-c8ca2466c3d6","resolution":{"observed_at":"2026-08-03T16:32:05.019151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-08T01:18:53.200448Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-03T16:32:03.229149Z","title":"Jailbreaking leading safety- aligned llms with simple adaptive attacks.arXiv preprint arXiv:2404.02151,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:03.229149Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:e8d239b4737b2b3ec0efffd867aecdcbaa6f5f1ec9affb6020b25f314ca9dbc2","observation_id":"1eed1946-ed36-448a-8bc9-922f65ba0adf","resolution":{"observed_at":"2026-08-03T16:32:03.229149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T16:32:03.820766Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:03.820766Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:366348e3fd64b6dd134217dd5ffd123fc77112110647b3743a377b56f5449bcd","observation_id":"9bc1f7c2-9e55-40b0-adbf-cf44297a0133","resolution":{"observed_at":"2026-08-03T16:32:03.820766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-07-06T13:54:56.779166Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-03T16:32:03.699008Z","title":"Toy models of superposition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:03.699008Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:c507d68305595301c3cca02a6a1aa69c7e67d9a83c4a199a35f5db2208cfe01c","observation_id":"47f5e25e-dfc7-4f77-a259-9fca08aa7157","resolution":{"observed_at":"2026-08-03T16:32:03.699008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-03T16:32:04.732124Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal.arXiv preprint arXiv:2402.04249,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:04.732124Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:1ed683cf7f8414ab9fac2cbf28a158ff8f7c1d854737f214eef93cd8f4bce4ee","observation_id":"59d6cbe8-68ab-46d9-8c3e-f35e0b6373a3","resolution":{"observed_at":"2026-08-03T16:32:04.732124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:03.608483Z","title":"Mixat: Combining continuous and discrete adversarial training for llms.arXiv preprint arXiv:2505.16947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:03.608483Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:d1a95fbd6a332a8da958343dd454e46902b4d8f058357e8bd1885b24e6e350eb","observation_id":"a624ce2a-ef17-492b-88e7-954ac420c852","resolution":{"observed_at":"2026-08-03T16:32:03.608483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:32:03.423049Z","title":"Towards understanding safety alignment: A mechanistic perspective from safety neurons.arXiv preprint arXiv:2406.14144,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:03.423049Z"},"links":{"citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:e798e8a81d3700e06e06779c644c0af2ec0bb90cf2e258ecc7b3faf651e0447b","observation_id":"8ea2f2d8-3de5-4382-8e84-a4fd76f9be3c","resolution":{"observed_at":"2026-08-03T16:32:03.423049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05030","last_updated":"2025-07-29T09:44:14Z","snapshot_observed_at":"2026-08-07T17:43:00.958834Z","submitted_at":"2024-03-08T04:22:48Z","title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05030","snapshot_observed_at":"2026-08-03T16:32:03.312558Z","title":"Defending against unforeseen failure modes with latent adversarial training.arXiv preprint arXiv:2403.05030,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T16:32:03.312558Z"},"links":{"cited_paper":"/paper/2403.05030","citing_paper":"/paper/2607.28959"},"observation_digest":"sha256:fc353e14b72367fd37c3d93111dfbbd0f7b73b21b7e120d7f0e4589f2c20f936","observation_id":"9c23aac0-fd84-4bc8-8368-9b8bd121bffc","resolution":{"observed_at":"2026-08-03T16:32:03.312558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28959","last_updated":"2026-07-31T02:26:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T11:30:35.233810Z","submitted_at":"2026-07-31T02:26:04Z","title":"Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.28959."}