{"as_of":"2026-08-18T02:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf41a13f7a75b2518e7333a8808fb9d6d757a37ab374e51dcf868fb94e6c2f55","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:08:01.799775Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T15:26:23.290009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T15:27:20.106151Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"cited_work":{"arxiv_id":"2501.10639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.10639","snapshot_observed_at":"2026-07-10T15:27:20.106151Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","venue":"cs.CR","work_id":"0275f023-400a-401e-8131-5f8d0cbc597a","year":2025},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-08-14T18:25:59Z","snapshot_observed_at":"2026-08-18T02:11:55.491578Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2501.10639","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:dd1391e56aac29e04190fa62bad898317b2c531efffa51228f8444ed324a837f","observation_id":"ee1a0b98-dd8a-45a9-b9d0-7bf12bcd306d","resolution":{"observed_at":"2026-07-10T15:27:20.107446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.10639/citation-record","integrity":"/paper/2501.10639/integrity","json":"/paper/2501.10639/citation-record.json","paper":"/paper/2501.10639"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-16T14:04:12.947538Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-10T19:08:01.566687Z","title":", author Croce, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.566687Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:656d6d9d5e8917985cd1563c0fcb44fef36ccd85dbf2a6ba6f4c954ea9132514","observation_id":"e0dddf4d-c200-4382-af12-531fb113d44c","resolution":{"observed_at":"2026-08-10T19:08:01.566687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-08-17T07:39:23.832733Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-10T19:08:01.571828Z","title":", author Obeso, O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.571828Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:b7b23d7dc05728c8584d117421b5a310bccbb2a81c35b4d92291bcae7cadeacc","observation_id":"5189c3aa-57f5-4e1d-ad00-3031b6a7f22f","resolution":{"observed_at":"2026-08-10T19:08:01.571828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-10T19:08:01.578805Z","title":", author Jones, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.578805Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:17ed5147c21e22fad778e77febc6c2da1c53a45c2901414e16460329a058c0e5","observation_id":"9888649f-64a0-4d39-860d-ab2b2a2291d8","resolution":{"observed_at":"2026-08-10T19:08:01.578805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.560824Z","title":", author Ghosh, S","venue":null,"work_id":"f677058c-1dba-466d-a1b6-70768f0137eb","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.583668Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:e38570b3878c327cb0479a0d4df0ce58146e2adeef74d66a3b6c80090c27cb5a","observation_id":"b189b13d-7f8c-41dd-9fd9-c0b334bbead5","resolution":{"observed_at":"2026-08-10T19:08:02.565008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.547811Z","title":", author Ye, H","venue":null,"work_id":"6dcef5a8-9c70-4075-b34b-56f214ff2a3f","year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.588539Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:a0d2f64a03cd2ee7560c6888bcca4ec3e3310ed09634575a22a26f8a61b8d556","observation_id":"c67ebe50-2a32-408a-8f48-c3504b14a518","resolution":{"observed_at":"2026-08-10T19:08:02.551904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05030","last_updated":"2025-07-29T09:44:14Z","snapshot_observed_at":"2026-08-16T14:11:44.969689Z","submitted_at":"2024-03-08T04:22:48Z","title":"Defending Against Unforeseen Failure Modes with Latent Adversarial Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05030","snapshot_observed_at":"2026-08-10T19:08:01.593502Z","title":", author Schulze, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.593502Z"},"links":{"cited_paper":"/paper/2403.05030","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:f16847c900e2929683977c35cd55c3831a254367c0238608226aa7289fd95c52","observation_id":"c7cf5986-6253-44bc-b21d-cd996d3ce9f1","resolution":{"observed_at":"2026-08-10T19:08:01.593502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-10T19:08:01.599083Z","title":", author Debenedetti, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.599083Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:cafc32469c02aecb38fbdb594b274d3955368bf4b8a48143e9c9424cea40051f","observation_id":"d2ac95ef-8939-4c86-9984-a03b39db9a6f","resolution":{"observed_at":"2026-08-10T19:08:01.599083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.534029Z","title":", author Robey, A","venue":null,"work_id":"1a36ff90-dce8-4b00-b98a-d07c527eac08","year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.604071Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:b146887061213966d017417a8cfead8b4c397c40920814d70ff3cfbd522e2add","observation_id":"1d04c9aa-2ef6-4740-8ab8-0f33ee4c147d","resolution":{"observed_at":"2026-08-10T19:08:02.538492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-08-16T13:47:22.319152Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-08-10T19:08:01.608940Z","title":", author Chiang, W.L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.608940Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:62d0437e60335ef1c4ddb142199d5dece77778968c7c62e431447fbc6f454290","observation_id":"c530ab1e-d492-41e7-8627-266a1c0dfe3b","resolution":{"observed_at":"2026-08-10T19:08:01.608940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.520622Z","title":", author Ruoss, A","venue":null,"work_id":"981c8db1-c6bb-4af9-bb1d-686046620ce2","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.614032Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:31a5d86ecf74b75996fe6d7e0db714112cdd3e27da7612e660075525977c55e7","observation_id":"cd124da8-9e9e-4263-b6e3-6b983ac61d1a","resolution":{"observed_at":"2026-08-10T19:08:02.524902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.506160Z","title":", author Chen, Y","venue":null,"work_id":"3b301d0e-7adf-4f81-8fdd-016cd603790a","year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.618703Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:30ebfac93a556cda21ed6e017f96b485ff8e54b4e12addf247bc34f5c9806660","observation_id":"bdfe378a-b3be-4cf4-9931-f706dc698eb1","resolution":{"observed_at":"2026-08-10T19:08:02.511111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14488","last_updated":"2024-05-23T12:19:59Z","snapshot_observed_at":"2026-08-16T13:50:14.304374Z","submitted_at":"2024-05-23T12:19:59Z","title":"MoGU: A Framework for Enhancing Safety of Open-Sourced LLMs While Preserving Their Usability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14488","snapshot_observed_at":"2026-08-10T19:08:01.623284Z","title":", author Zhao, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.623284Z"},"links":{"cited_paper":"/paper/2405.14488","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:2db86c268621fb992be64385e54331de160816e64b438b0d4e8b4289729755e9","observation_id":"97378996-f677-4d99-ad7e-a4440b3760e1","resolution":{"observed_at":"2026-08-10T19:08:01.623284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14866","last_updated":"2025-03-03T07:25:21Z","snapshot_observed_at":"2026-08-16T13:16:19.722085Z","submitted_at":"2024-09-23T10:03:09Z","title":"PAPILLON: Efficient and Stealthy Fuzz Testing-Powered Jailbreaks for LLMs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14866","snapshot_observed_at":"2026-08-10T19:08:01.628010Z","title":", author Li, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.628010Z"},"links":{"cited_paper":"/paper/2409.14866","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:0b6974e65b59b666d2afa15a6b964b13eb2fb4569354317b30a1b0c383961575","observation_id":"94febe71-c2b2-4e3a-8d95-b055e2ad8e64","resolution":{"observed_at":"2026-08-10T19:08:01.628010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.491755Z","title":", author Yu, F","venue":null,"work_id":"a480a818-cefb-448c-8fc3-58acc3b10a78","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.632772Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:80d2495ffdd755054690a32a872fed361a4f1b57a67cdc8907165ee8fa0bc072","observation_id":"dcdc1a55-96d3-4e61-bdcd-9bfbe6f56725","resolution":{"observed_at":"2026-08-10T19:08:02.496311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.477617Z","title":", author Burns, C","venue":null,"work_id":"ba1e42ed-24c5-43cd-b8a4-f8eb75d3f3ed","year":2021},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.637090Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:ff7812e5d23c8aa0b3902d5e252918214ae476178cb209c7fee6476782771e5e","observation_id":"8d403bd6-9448-4d89-8a6a-d07e32812eae","resolution":{"observed_at":"2026-08-10T19:08:02.482280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00740","last_updated":"2024-08-09T22:00:11Z","snapshot_observed_at":"2026-08-16T15:43:19.736565Z","submitted_at":"2023-04-03T06:24:10Z","title":"Inspecting and Editing Knowledge Representations in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00740","snapshot_observed_at":"2026-08-10T19:08:01.641136Z","title":", author Li, B.Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.641136Z"},"links":{"cited_paper":"/paper/2304.00740","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:36b51a8dfa2e51dbabaf750346b9b6eaac2986845a18c41171a3fda8af055c4d","observation_id":"fe449179-5845-4b2c-821b-386d09820afe","resolution":{"observed_at":"2026-08-10T19:08:01.641136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21018","last_updated":"2024-06-05T16:35:49Z","snapshot_observed_at":"2026-08-16T13:47:20.509713Z","submitted_at":"2024-05-31T17:07:15Z","title":"Improved Techniques for Optimization-Based Jailbreaking on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21018","snapshot_observed_at":"2026-08-10T19:08:01.645564Z","title":", author Pang, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.645564Z"},"links":{"cited_paper":"/paper/2405.21018","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:95329b7367dc7a91c6c902fa3262ae6dd91ec3e63976768b012bb84230847b79","observation_id":"9c367882-5566-4d4f-baab-1155ff1a9ef4","resolution":{"observed_at":"2026-08-10T19:08:01.645564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.462998Z","title":", author Choi, E","venue":null,"work_id":"1295d3b3-8a98-4971-b10d-47106182e122","year":2017},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.649858Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:320d4207462979dafecf76100e8e951b281722f00ad4a691bc89434a847e7a2d","observation_id":"f8e218e1-6d2d-4e11-b27d-620525c5b7c6","resolution":{"observed_at":"2026-08-10T19:08:02.467635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.450436Z","title":", author Li, X","venue":null,"work_id":"f0dd8d2a-e1c7-4f46-bc48-8efe78be77c8","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.654313Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:2dbe8526ea4acb2bf2c2934f31c680c6756aabe25bf10f4a4a1aeff1b81e5d0c","observation_id":"d697efc6-c479-4a4c-b0ff-2a0700cfffb6","resolution":{"observed_at":"2026-08-10T19:08:02.454451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.437801Z","title":", author G \\\"u rel, N.M","venue":null,"work_id":"1866af6f-1b18-4e11-a34d-3aa2f2c9e818","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.658208Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:4372628a1690b4acd590196ede445d9cf3bd7bff13f82cc1069c139867a5c704","observation_id":"a5e4a53d-703d-4811-b94d-203576856598","resolution":{"observed_at":"2026-08-10T19:08:02.441977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.422807Z","title":", author Al-Rfou, R","venue":null,"work_id":"48ae550b-c106-4ccb-9e74-9b07f7fa84ca","year":2021},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.662138Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:8a5dc82d5c6427e72a141792df2ade56a45544a3b359861c70b830dfd4973bd4","observation_id":"a2e3eaa3-3127-4a17-9a5e-66867126df9b","resolution":{"observed_at":"2026-08-10T19:08:02.426978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06824","last_updated":"2025-02-21T05:17:52Z","snapshot_observed_at":"2026-08-16T18:59:00.421775Z","submitted_at":"2024-01-12T00:50:04Z","title":"Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06824","snapshot_observed_at":"2026-08-10T19:08:01.666387Z","title":", author Zheng, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.666387Z"},"links":{"cited_paper":"/paper/2401.06824","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:323fce3343a9f0b8e1b2476709da0ceaa84258cbbed37542623c85661f48660c","observation_id":"6be3978e-c578-4853-b6b2-d25fb739904e","resolution":{"observed_at":"2026-08-10T19:08:01.666387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07921","last_updated":"2024-11-24T18:03:43Z","snapshot_observed_at":"2026-08-17T21:47:51.183917Z","submitted_at":"2024-04-11T17:05:50Z","title":"AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07921","snapshot_observed_at":"2026-08-10T19:08:01.671246Z","title":", author Sun, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.671246Z"},"links":{"cited_paper":"/paper/2404.07921","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:d6250302c80cd794db96aa19053f5bc7f3c50e010ed40866ca31b3feeaa575f3","observation_id":"ee780b3c-0826-449c-ab4c-ea88790560ba","resolution":{"observed_at":"2026-08-10T19:08:01.671246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06622","last_updated":"2024-06-07T15:37:15Z","snapshot_observed_at":"2026-08-16T13:45:06.275715Z","submitted_at":"2024-06-07T15:37:15Z","title":"Adversarial Tuning: Defending Against Jailbreak Attacks for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06622","snapshot_observed_at":"2026-08-10T19:08:01.675859Z","title":", author Xu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.675859Z"},"links":{"cited_paper":"/paper/2406.06622","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:58861d87ad4f3e639af052a9717338a9ab8359f6077c87089e16a2f7179039f5","observation_id":"8214eded-d1f5-4045-a1ef-9b3c8ccda58b","resolution":{"observed_at":"2026-08-10T19:08:01.675859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.409809Z","title":", author Xu, N","venue":null,"work_id":"9cd574dc-40f9-4f3b-bbf7-fe9a1d157e87","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.681800Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:6a11dd9773fe48ba5d4f2443478ef03e4862ba1dfac7ee582db3804ba4bbb20a","observation_id":"8081f179-da4f-4f01-9f50-a433654c7da6","resolution":{"observed_at":"2026-08-10T19:08:02.413897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.396697Z","title":", author Feng, Z","venue":null,"work_id":"ace0a425-1225-4099-875e-3c2dd2739630","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.686421Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:84e536e4429264524add71044331e701cc0b79435f66bb7f84235ca5fe345e81","observation_id":"c1595a31-3a4c-489e-9d57-1e06d74e2ae0","resolution":{"observed_at":"2026-08-10T19:08:02.400845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.383486Z","title":", author Phan, L","venue":null,"work_id":"2e8cbb72-0dbb-473c-a6ae-93f6e1e0e456","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.691155Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:2a9843c650f81fe8313b9a8c41ad640931ca879757433f19cd9b19a5bb399803","observation_id":"63b0eb18-1d74-4ad7-8018-a6f9b920b10e","resolution":{"observed_at":"2026-08-10T19:08:02.387649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-08-17T16:15:31.338042Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-10T19:08:01.696363Z","title":", author Zampetakis, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.696363Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:caa314ee7d0be309a0cc520d05715b621ab2f9c660eb78781f90a1393899f767","observation_id":"9e20dac0-cba0-46c5-872f-f3e9580ec8f9","resolution":{"observed_at":"2026-08-10T19:08:01.696363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-15T08:04:06.283165Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-10T19:08:01.701320Z","title":", author Gabrieli, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.701320Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:19cdb7a21f83b621d18b04af35d8b57d3066992cd213c5f2e2127b7750729de4","observation_id":"c8102a52-8326-4d43-a705-e939f9ecd07a","resolution":{"observed_at":"2026-08-10T19:08:01.701320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.370059Z","title":", author Wong, E","venue":null,"work_id":"c81e1dee-b4a0-48d4-bde1-a9b7ff781c4e","year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.706116Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:7fb3c201fcd50b44fd86ba557790a0dde4411b039793606c6f9d664fb8856fa7","observation_id":"6607a1e4-649e-4bdf-9212-e6e75f0cdb88","resolution":{"observed_at":"2026-08-10T19:08:02.374326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02298","last_updated":"2025-02-07T06:23:17Z","snapshot_observed_at":"2026-08-16T13:13:03.361185Z","submitted_at":"2024-10-03T08:34:17Z","title":"Jailbreak Antidote: Runtime Safety-Utility Balance via Sparse Representation Adjustment in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02298","snapshot_observed_at":"2026-08-10T19:08:01.711503Z","title":", author Zhao, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.711503Z"},"links":{"cited_paper":"/paper/2410.02298","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:0558c2858ec04bfb6510a2a9a348d01f9205a8287a5730d7aa218892788630b7","observation_id":"04604d75-cde7-4c1e-a00b-1aff869832e0","resolution":{"observed_at":"2026-08-10T19:08:01.711503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-08-16T09:32:10.049300Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-10T19:08:01.716089Z","title":"do anything now","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.716089Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:5c81a3132a2ced21b7ed607f990b7ac21aaa71f372576a699702d2bf7e55acf0","observation_id":"2b769401-6465-427b-8405-f0c8a8162dec","resolution":{"observed_at":"2026-08-10T19:08:01.716089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15549","last_updated":"2025-07-29T09:37:22Z","snapshot_observed_at":"2026-08-16T13:32:11.184868Z","submitted_at":"2024-07-22T11:19:14Z","title":"Latent Adversarial Training Improves Robustness to Persistent Harmful Behaviors in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15549","snapshot_observed_at":"2026-08-10T19:08:01.720455Z","title":", author Ewart, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.720455Z"},"links":{"cited_paper":"/paper/2407.15549","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:b4d82c7653e84121cbc70c8c5c7300c31fbbe07b53200f86fa6adac862fe3ac3","observation_id":"f0417e44-1297-491b-ab59-55f0d9698a60","resolution":{"observed_at":"2026-08-10T19:08:01.720455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.354323Z","title":", author Chen, K","venue":null,"work_id":"db1697a3-26ad-42cd-bc6e-9ffec059dd6f","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.724684Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:7afb234d3bd517468133a561dda7a5eac3a141da9c73c158e5321f8d43772f35","observation_id":"181e5b86-7bd9-43df-8c52-5359bc7c1512","resolution":{"observed_at":"2026-08-10T19:08:02.359315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12299","last_updated":"2025-02-24T21:01:53Z","snapshot_observed_at":"2026-08-16T13:08:55.447888Z","submitted_at":"2024-10-16T06:58:49Z","title":"Semantics-Adaptive Activation Intervention for LLMs via Dynamic Steering Vectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12299","snapshot_observed_at":"2026-08-10T19:08:01.728950Z","title":", author Yang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.728950Z"},"links":{"cited_paper":"/paper/2410.12299","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:766c8562707722460aa2bf75ea54effa0b6d108405b8082d0a96eeca4b88662d","observation_id":"ca1e0899-d08a-4dda-983b-41757f54af9f","resolution":{"observed_at":"2026-08-10T19:08:01.728950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.338795Z","title":", author Haghtalab, N","venue":null,"work_id":"2e614a8b-f2ba-41a6-90e5-b5e803e1cc52","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.733123Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:7f50365a4b9e371f2be14949383ec48f99af2b13f2c2d592314b6487ad70b4f9","observation_id":"049bbf7f-8aca-4712-b114-6937e92cb423","resolution":{"observed_at":"2026-08-10T19:08:02.343484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-16T14:53:33.115609Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T19:08:01.737120Z","title":", author Wang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.737120Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:104e1f201c1bdd0bc731064450b1beba4ca01b713bfd4e4ba8d843bc3b88a6ae","observation_id":"19cf3e0d-9de7-48fe-b988-f87b47517819","resolution":{"observed_at":"2026-08-10T19:08:01.737120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.323398Z","title":", author Yi, J","venue":null,"work_id":"8351563a-98f8-4da0-9abe-23ceb130b189","year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.741382Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:572d1dbe59fe2b4ad16255a91c7e99f07689cf52fc37b638161461e3c3f84fba","observation_id":"9163df2c-75da-4783-9748-385de29a21c1","resolution":{"observed_at":"2026-08-10T19:08:02.328209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.308407Z","title":", author Huang, R","venue":null,"work_id":"53907969-8b07-4c13-8d91-496f4ebd0935","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.745608Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:fdb695e7956c8d55506b0345216c1b46cc2b7209fe23d8c1905cc77224641dbf","observation_id":"24072a27-516c-470f-9abc-3e840554bcff","resolution":{"observed_at":"2026-08-10T19:08:02.312988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12038","last_updated":"2024-11-30T08:52:29Z","snapshot_observed_at":"2026-08-16T13:59:50.088003Z","submitted_at":"2024-04-18T09:46:25Z","title":"Uncovering Safety Risks of Large Language Models through Concept Activation Vector","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12038","snapshot_observed_at":"2026-08-10T19:08:01.749591Z","title":", author Huang, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.749591Z"},"links":{"cited_paper":"/paper/2404.12038","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:b43e1e317a89a5ce204ccef50f73a2bceb6f3e80a52834c61d07fd29bd50fbf4","observation_id":"0c14d0ef-7e00-433e-b8f6-874c769a2d98","resolution":{"observed_at":"2026-08-10T19:08:01.749591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.293236Z","title":", author Ye, R","venue":null,"work_id":"dfcc9493-4bbb-4d5c-a215-9ac025d74a3b","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.754352Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:375d63e002ea7d0100ca9aea31b947086d837aa4e62ea04395de3744d87566ac","observation_id":"b290920e-109b-4cc1-83dc-4f29b1d9f7a4","resolution":{"observed_at":"2026-08-10T19:08:02.298063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-10T19:08:01.758667Z","title":", author Lin, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.758667Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:6ec2ecc5207e3915dc2d6cd19bb9a22952944b6a427dda6de28f659d45a2f690","observation_id":"b5d3cf62-d8ef-4013-b15c-4e685fa11192","resolution":{"observed_at":"2026-08-10T19:08:01.758667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20089","last_updated":"2025-03-20T15:28:18Z","snapshot_observed_at":"2026-08-16T13:14:12.950870Z","submitted_at":"2024-09-30T08:41:39Z","title":"Robust LLM safeguarding via refusal feature adversarial training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20089","snapshot_observed_at":"2026-08-10T19:08:01.764576Z","title":", author Do, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.764576Z"},"links":{"cited_paper":"/paper/2409.20089","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:efd5aa3e3cf4352cb7bdb6d4878f83ec241ed6d4facefd7895af99c206dfcbbf","observation_id":"4fee971d-24aa-41bf-8321-ddf3da8abf56","resolution":{"observed_at":"2026-08-10T19:08:01.764576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04783","last_updated":"2024-11-14T18:14:00Z","snapshot_observed_at":"2026-08-16T14:13:28.210442Z","submitted_at":"2024-03-02T16:52:22Z","title":"AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04783","snapshot_observed_at":"2026-08-10T19:08:01.769602Z","title":", author Wu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.769602Z"},"links":{"cited_paper":"/paper/2403.04783","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:e131efba44176076d4b5f2f42b5203d9c0f119ffacf6cc59e40d8b7f897e011f","observation_id":"f76712e0-a05a-4230-92d8-9c76d534f4a9","resolution":{"observed_at":"2026-08-10T19:08:01.769602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13752","last_updated":"2024-11-01T07:51:36Z","snapshot_observed_at":"2026-08-16T13:59:05.510561Z","submitted_at":"2024-04-21T19:24:15Z","title":"Adversarial Representation Engineering: A General Model Editing Framework for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13752","snapshot_observed_at":"2026-08-10T19:08:01.773900Z","title":", author Wei, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.773900Z"},"links":{"cited_paper":"/paper/2404.13752","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:f7bf3ec30fcc581401537db6f09e61bb683b762d31be83afd915b9e0a6842bc4","observation_id":"10e3f891-9a1d-4105-ba86-3c0a9a86e5eb","resolution":{"observed_at":"2026-08-10T19:08:01.773900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18018","last_updated":"2024-06-03T06:52:58Z","snapshot_observed_at":"2026-08-16T14:22:47.564172Z","submitted_at":"2024-01-31T17:28:24Z","title":"On Prompt-Driven Safeguarding for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18018","snapshot_observed_at":"2026-08-10T19:08:01.778736Z","title":", author Yin, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.778736Z"},"links":{"cited_paper":"/paper/2401.18018","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:421a381c6b279ab8ac1d98e3fb5ca769efd039a542a0bea18d2dee7029c78fe9","observation_id":"4469a48d-a05d-45a0-a860-e2e544ac5b45","resolution":{"observed_at":"2026-08-10T19:08:01.778736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-10T19:08:01.783546Z","title":", author Phan, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.783546Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:41978e3c251512e5495a72b09859460090147021ffa61b78d04f47f081718ff1","observation_id":"38181aea-7c25-495f-89aa-4591513365cf","resolution":{"observed_at":"2026-08-10T19:08:01.783546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:02.276434Z","title":", author Phan, L","venue":null,"work_id":"4e624a4d-052a-4257-ad96-c62307dd41f9","year":2024},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.791055Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:2283230ea11a04aa1990801025da184738d8bd8ddd3c4648341cc0a3f1266731","observation_id":"45c68195-138c-429a-ad67-aac2c22e6de5","resolution":{"observed_at":"2026-08-10T19:08:02.282597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-10T19:08:01.795490Z","title":", author Wang, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.795490Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:ca249dc15a34e7bf2a74553895e0ff036062aa8ccea2cf3e4ab480951aaf147c","observation_id":"0d93d1b8-eeda-45b8-a0b4-ecfec518d5c7","resolution":{"observed_at":"2026-08-10T19:08:01.795490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:08:01.799775Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:01.799775Z"},"links":{"citing_paper":"/paper/2501.10639"},"observation_digest":"sha256:9f9c43276431ad6a9457cae29ff7612a948a88f24edd2c83e3654fa53f1ccc09","observation_id":"259f26f1-f9ba-4b42-b94c-8491424e6f70","resolution":{"observed_at":"2026-08-10T19:08:01.799775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.10639","last_updated":"2025-05-30T03:31:24Z","latest_version":3,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-16T08:22:51.927618Z","submitted_at":"2025-01-18T02:57:12Z","title":"Latent-space adversarial training with post-aware calibration for defending large language models against jailbreak attacks"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2501.10639."}