{"as_of":"2026-08-07T15:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a61e5af32a15a0424a035d00a5e5bcf1194d9d8ea3598819de1dc6b754e16eb8","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:40:20.752585Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:55:03.319920Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07402","snapshot_observed_at":"2026-08-01T18:55:03.319920Z","title":"arXiv preprint arXiv:2506.07402 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-05T14:31:41.750601Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:03.319920Z"},"links":{"cited_paper":"/paper/2506.07402","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:adfb1807f62b3d48d8c299f0c925214e997b2f28eacfb356b03095c14e713189","observation_id":"394b7429-0807-402b-917e-b5967f811225","resolution":{"observed_at":"2026-08-01T18:55:03.319920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07402/citation-record","integrity":"/paper/2506.07402/integrity","json":"/paper/2506.07402/citation-record.json","paper":"/paper/2506.07402"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:21.500199Z","title":"Universal language model fine-tuning for text classifica- tion, 2018","venue":null,"work_id":"94ab3aaf-b6f5-47fb-8b93-5d79d277b4b4","year":2018},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.514067Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:139aed87925b8aad4dfbafb8939c407bda2d6bf1672ec10efa17c0614ed9fbf4","observation_id":"7ac0cda6-c77c-48c6-99e7-985e17627304","resolution":{"observed_at":"2026-08-07T05:40:21.505766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:20.519392Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.519392Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:2e888343a11c51154f375732af236ed2fb7ba3152dbf91310820a9c877f01c30","observation_id":"7a8c6123-ac07-45b4-aaef-ea22fed4a683","resolution":{"observed_at":"2026-08-07T05:40:20.519392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:20.525164Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.525164Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:25312dd187e606f6121248715b46c6b538883fe50ae7c5b54ca438afa4d2cbe3","observation_id":"d7e06a19-25a4-49ea-9cf4-46033b91e68d","resolution":{"observed_at":"2026-08-07T05:40:20.525164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T05:40:20.529978Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.529978Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:f19e366d2ad50699b81d95bc9e970131d2b044df76957b903f3a94a117006d37","observation_id":"f687c9cc-53af-4811-acf1-5026fc9bf588","resolution":{"observed_at":"2026-08-07T05:40:20.529978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:20.535236Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.535236Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:b612abc043ca6693cab0428b5dff493cf12eed2207fa07f14064da6c654f1905","observation_id":"6938c8e7-dd8a-473b-a01a-e7b0717c189e","resolution":{"observed_at":"2026-08-07T05:40:20.535236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:21.435203Z","title":"Jailbreakchat.com, 2023","venue":null,"work_id":"64dee1eb-dbaa-462c-80aa-9837e049bf23","year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.539989Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:7f1ec23806a876589de321e05d8bf1069a82d0003506b745fbfd807550f54f1a","observation_id":"be8403d9-f7ee-4916-a14e-cf1608a7fa44","resolution":{"observed_at":"2026-08-07T05:40:21.439636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:20.545428Z","title":"Jailbroken: How does llm safety training fail? Advances in Neural Information Processing Systems, 36:80079–80110, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.545428Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:a0aa8359a829f37a4816707ae679ef9ddc22666ed36fcf2049a0bfaf19b2246b","observation_id":"f6ff2025-0476-4e55-9c57-d49f5a91cb13","resolution":{"observed_at":"2026-08-07T05:40:20.545428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:21.410388Z","title":"Are aligned neural networks adversarially aligned? Advances in Neural Information Processing Systems, 36:61478– 61500, 2023","venue":null,"work_id":"15341aa8-1446-455d-ae39-9827991e1b0b","year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.550874Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:05c966249ed44d2a21c3f6dafa389dae58a1575817ac68125dc273dc99af3632","observation_id":"2f1a9f34-036d-4335-8a32-9f3ab8954e01","resolution":{"observed_at":"2026-08-07T05:40:21.415500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:20.555354Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.555354Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:91b0db8ea386eddc7c30521ea5f98b2dd01b9fc378f558c0867a83dabdd1dbdc","observation_id":"bd3b9ee6-56ab-4793-ba5a-dc13d7fd6fcf","resolution":{"observed_at":"2026-08-07T05:40:20.555354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:21.385732Z","title":"Don’t listen to me: understanding and exploring jailbreak prompts of large language models","venue":null,"work_id":"48c67d77-cc93-440b-b8d1-045f50fba1f9","year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.560611Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:0d649bf27111805e1fa2f95a4eeb6808f7320610b33a1a290b4770cabe4e889b","observation_id":"a1753045-f0d9-442a-aecf-64ed9abd11ff","resolution":{"observed_at":"2026-08-07T05:40:21.390445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T05:40:20.565977Z","title":"Universal and transferable adversarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.565977Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:d0a63181d04a6cb6d84d74e94668748f29474429838ef8f48b1d2bd9183d262a","observation_id":"ac5bca8e-c73d-4f9e-90ca-fa8bed0495f8","resolution":{"observed_at":"2026-08-07T05:40:20.565977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T05:40:20.570649Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.570649Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:ca391d566c60a46325ee71571bf87cf288b20f07afbce00532dfb452e324ca74","observation_id":"36c6d1dc-e66c-4e72-868b-e30305efdd7a","resolution":{"observed_at":"2026-08-07T05:40:20.570649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:20.575426Z","title":"Tree of attacks: Jailbreaking black-box llms automatically.Advances in Neural Information Processing Systems, 37:61065–61105, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.575426Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:1c7969248b94e1f5ad8ee2d239f7411756aad30d47fe8dc326499852e119b5f2","observation_id":"7d463ea2-dc58-4f1d-b807-d3b19f063b03","resolution":{"observed_at":"2026-08-07T05:40:20.575426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08715","last_updated":"2023-10-25T07:30:51Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-16T01:07:15Z","title":"MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08715","snapshot_observed_at":"2026-08-07T05:40:20.580018Z","title":"Masterkey: Automated jailbreak across multiple large language model chatbots","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.580018Z"},"links":{"cited_paper":"/paper/2307.08715","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:0aaa7a4b073e92da964291ced9e669da3e1b9d6d7bf7a61cdb8e9e8be64ef478","observation_id":"ff06be60-b1ab-4ac7-b4c7-f3d678f2af6b","resolution":{"observed_at":"2026-08-07T05:40:20.580018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-07-06T17:54:43.685212Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-07T05:40:20.585362Z","title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.585362Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:579f1d19c311a6d26766c3ef3922c9aca494b7a314b5a7f8d362ed9a05b23fb4","observation_id":"afa7ba33-3fe7-41de-877d-2461d41a0ce3","resolution":{"observed_at":"2026-08-07T05:40:20.585362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-07T05:40:20.590342Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.590342Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:9b469f5cc34e4c1e323bea33489e5de1d4952311ce2713ae5cdca2656a7014a1","observation_id":"d202259b-976c-48e2-8129-af12e45802bc","resolution":{"observed_at":"2026-08-07T05:40:20.590342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15140","last_updated":"2023-12-14T06:22:51Z","snapshot_observed_at":"2026-08-03T19:47:58.067345Z","submitted_at":"2023-10-23T17:46:07Z","title":"AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15140","snapshot_observed_at":"2026-08-07T05:40:20.595942Z","title":"Autodan: interpretable gradient-based adversarial attacks on large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.595942Z"},"links":{"cited_paper":"/paper/2310.15140","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:68a4f724f112c1e2f854b1aff5348bcabe6cfa55956d92d1c4ee4a34da5eb14e","observation_id":"da3d46d1-a7b7-4829-a1a1-a80d0775e3ca","resolution":{"observed_at":"2026-08-07T05:40:20.595942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-07T05:40:20.601664Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.601664Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:930bbc335ad5393b93408cdfbe5b799fc73ee09f156e631e441064374db9d67e","observation_id":"8cd526e5-5d8d-4e82-91ab-2b9b4db91aa4","resolution":{"observed_at":"2026-08-07T05:40:20.601664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-07-06T17:22:41.286422Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-08-07T05:40:20.606600Z","title":"Weak-to-strong jailbreaking on large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.606600Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:af24c79450522727c6969d2387b2c31ca7f9ada9bced66ff5a70ea3189d30567","observation_id":"595452c4-6357-4760-8f52-30d432d8a57b","resolution":{"observed_at":"2026-08-07T05:40:20.606600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-05T10:26:02.067012Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-07T05:40:20.611175Z","title":"Advprompter: Fast adaptive adversarial prompting for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.611175Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:0e26a73022294625abe0f7ac6531c37c033042698f915d2ecb1b85b1db56a87f","observation_id":"81904555-64f5-41c7-a0fe-bfecc3e67c03","resolution":{"observed_at":"2026-08-07T05:40:20.611175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21018","last_updated":"2024-06-05T16:35:49Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T17:07:15Z","title":"Improved Techniques for Optimization-Based Jailbreaking on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21018","snapshot_observed_at":"2026-08-07T05:40:20.616360Z","title":"Improved techniques for optimization-based jailbreaking on large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.616360Z"},"links":{"cited_paper":"/paper/2405.21018","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:e351b7ed0f535fd68a81669bc6279fb7714ce6996598cea812382530cb084c5f","observation_id":"72aa392a-d53a-4eb3-8989-88f9158796ad","resolution":{"observed_at":"2026-08-07T05:40:20.616360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16369","last_updated":"2025-07-02T07:27:32Z","snapshot_observed_at":"2026-07-06T18:05:20.955471Z","submitted_at":"2024-04-25T07:15:23Z","title":"Don't Say No: Jailbreaking LLM by Suppressing Refusal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16369","snapshot_observed_at":"2026-08-07T05:40:20.621417Z","title":"Don’t say no: Jailbreaking llm by suppressing refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.621417Z"},"links":{"cited_paper":"/paper/2404.16369","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:7e82599c42c8579ae270cf8d5dba5d9ba4689a99cde0d70bafe80a25ede541fe","observation_id":"72ba783a-5b5a-4037-a109-1035b69cdfe8","resolution":{"observed_at":"2026-08-07T05:40:20.621417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07921","last_updated":"2024-11-24T18:03:43Z","snapshot_observed_at":"2026-07-06T17:58:56.081219Z","submitted_at":"2024-04-11T17:05:50Z","title":"AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07921","snapshot_observed_at":"2026-08-07T05:40:20.626685Z","title":"Amplegcg: Learning a universal and transferable generative model of adversarial suffixes for jailbreaking both open and closed llms.arXiv preprint arXiv:2404.07921, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.626685Z"},"links":{"cited_paper":"/paper/2404.07921","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:ca98b40500492a3862784e4f6dce27498221a65cb3f44014bf7e16649e29d1cf","observation_id":"95cbf8a9-6f0a-4ea8-b67d-d55cec96b58f","resolution":{"observed_at":"2026-08-07T05:40:20.626685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05295","last_updated":"2025-04-22T05:20:39Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-03T17:59:01Z","title":"AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05295","snapshot_observed_at":"2026-08-07T05:40:20.632046Z","title":"Autodan-turbo: A lifelong agent for strategy self-exploration to jailbreak llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.632046Z"},"links":{"cited_paper":"/paper/2410.05295","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:fa5c7f6833f771a74d9a52bb9345b7050e07e7135f25f303db51a30ad4af17ae","observation_id":"37d45666-6cd8-4238-a472-ce1bc8adba7e","resolution":{"observed_at":"2026-08-07T05:40:20.632046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-07T05:40:20.636809Z","title":"Jailbreak attacks and defenses against large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.636809Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:37545478555aa9d67136a8adec808f178b11cbb94d37353efb37e3ee08371df7","observation_id":"7d542fe5-5475-47de-b4ff-013c8b89ec90","resolution":{"observed_at":"2026-08-07T05:40:20.636809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:21.360153Z","title":"Llm jailbreak attack versus defense techniques–a comprehensive study","venue":null,"work_id":"794e1918-2656-454b-957f-f40ba5c0e742","year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.642041Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:59659b42724e64d889f5f254ce90abc8af7f6efa1a368744da058f2c3ffd5a4e","observation_id":"9bcc24c3-5661-475e-b745-7e0a568132f8","resolution":{"observed_at":"2026-08-07T05:40:21.365440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02574","last_updated":"2026-05-18T17:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-04T12:55:07Z","title":"LLM-Safety Evaluations Lack Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02574","snapshot_observed_at":"2026-08-07T05:40:20.646900Z","title":"Llm-safety evaluations lack robustness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.646900Z"},"links":{"cited_paper":"/paper/2503.02574","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:1a200b0263648e040904298648021373cd4ffac3f51ff22d2ad27ff1b1452881","observation_id":"ec8ff256-1793-4bab-b989-42bd5d49e3b0","resolution":{"observed_at":"2026-08-07T05:40:20.646900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05668","last_updated":"2025-05-26T12:56:04Z","snapshot_observed_at":"2026-07-06T17:27:24.955378Z","submitted_at":"2024-02-08T13:42:50Z","title":"JailbreakRadar: Comprehensive Assessment of Jailbreak Attacks Against LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05668","snapshot_observed_at":"2026-08-07T05:40:20.651700Z","title":"Com- prehensive assessment of jailbreak attacks against llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.651700Z"},"links":{"cited_paper":"/paper/2402.05668","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:e9b445a03e03fb065a7f07436ef6c3d14149bbe069bdf9d3322ce3cfca364869","observation_id":"b2eaf344-2622-4f66-b217-4850c0eb5904","resolution":{"observed_at":"2026-08-07T05:40:20.651700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:21.344587Z","title":"Sg-bench: Evaluating llm safety generalization across diverse tasks and prompt types","venue":null,"work_id":"c6443ab8-67bd-48ff-a9e5-54c8f17de803","year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.657041Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:139401e02034a48753f20c102dbd7f8c518d17478c7f0a0ceec301288abe9904","observation_id":"f20d886e-3a37-4af6-864a-5e093bcc8e5e","resolution":{"observed_at":"2026-08-07T05:40:21.349668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-07T05:40:20.661675Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.661675Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:17c179581c111ac727e3b2e862cc248d891a3a1dae636164531efb43b3844dba","observation_id":"ebeab4e4-5f8f-4310-a1ba-9de7ff330d25","resolution":{"observed_at":"2026-08-07T05:40:20.661675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09321","last_updated":"2025-02-04T16:04:22Z","snapshot_observed_at":"2026-08-07T04:50:27.342492Z","submitted_at":"2024-06-13T16:59:43Z","title":"JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09321","snapshot_observed_at":"2026-08-07T05:40:20.666525Z","title":"Jailbreakeval: An integrated toolkit for evaluating jailbreak attempts against large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.666525Z"},"links":{"cited_paper":"/paper/2406.09321","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:2b8234888eae047bc25e38cc493a0e587b82ed74938cbc7b2f8857b060f0f0ae","observation_id":"51c51fb7-d940-44ea-83c4-8445e1beb86d","resolution":{"observed_at":"2026-08-07T05:40:20.666525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:21.328149Z","title":"Clas 2024: The competition for llm and agent safety","venue":null,"work_id":"63c6a172-a317-4df5-9a20-867fc778f960","year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.671409Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:5a7a1f547c5d689ec9232bcfcd547db23078507eff42856eab01a5041927ecce","observation_id":"3f30fa75-a85a-42b8-b79d-0bb40852e600","resolution":{"observed_at":"2026-08-07T05:40:21.333247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10260","snapshot_observed_at":"2026-08-07T05:40:20.676687Z","title":"A strongreject for empty jailbreaks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.676687Z"},"links":{"cited_paper":"/paper/2402.10260","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:c4261523036fa52960243df77d9b136aa0bda07c73471bc3874a62db5ca67d9e","observation_id":"7db82a51-965f-4deb-8037-686fccefef3d","resolution":{"observed_at":"2026-08-07T05:40:20.676687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:20.682110Z","title":"The art of saying no: Contextual noncompliance in language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.682110Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:49a973d92e6567f904a0437bf2c2cc8685a80a381d425673f40d6587cb4db372","observation_id":"606f5adb-80f0-41a5-8703-0e69f61b6ff6","resolution":{"observed_at":"2026-08-07T05:40:20.682110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:21.301973Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":"cbc0cf94-15b1-45f2-b492-98aa45d324c2","year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.686767Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:5b2964cbce3321e151950ba1da52e11f3b4688011d0ddd7b30d3fe7c8765dbef","observation_id":"931ffb9d-d955-4d82-b723-9b4705eebfc9","resolution":{"observed_at":"2026-08-07T05:40:21.307575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:21.286079Z","title":"Jailbreaking large language models with symbolic mathematics, 2024","venue":null,"work_id":"afcc6a83-ddcc-4b59-9f49-508572bb7b61","year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.691795Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:5e78723ff540b70896b37ac94d324a9d2a3a7fc91ee3bf28095d98478bd9d575","observation_id":"a0dc3ecf-570a-4d1e-ae01-7785e1e52f36","resolution":{"observed_at":"2026-08-07T05:40:21.291327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-07T05:40:20.696608Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.696608Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:5168370550187c3862429242d3a3a19f2e54d7aeb320acf1b7ad77b3086ff7ea","observation_id":"5b995f12-018a-4ea8-83a6-6fbb92a7a99d","resolution":{"observed_at":"2026-08-07T05:40:20.696608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21038","last_updated":"2025-08-25T20:17:00Z","snapshot_observed_at":"2026-08-06T06:53:37.842976Z","submitted_at":"2025-04-28T07:38:43Z","title":"Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21038","snapshot_observed_at":"2026-08-07T05:40:20.701570Z","title":"Prefill-based jailbreak: A novel approach of bypassing llm safety boundary","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.701570Z"},"links":{"cited_paper":"/paper/2504.21038","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:d58a36b45d732474b29a38783e6275241d90edb46bf55ff562125bac42e37333","observation_id":"34268b1e-ffbf-4159-9ee4-6aeecca7a4bf","resolution":{"observed_at":"2026-08-07T05:40:20.701570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06407","last_updated":"2024-05-07T14:06:23Z","snapshot_observed_at":"2026-07-06T17:57:52.364338Z","submitted_at":"2024-04-09T15:54:16Z","title":"Rethinking How to Evaluate Language Model Jailbreak","version":3},"cited_work":{"arxiv_id":"2404.06407","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.06407","snapshot_observed_at":"2026-08-07T05:40:20.919321Z","title":"Rethinking How to Evaluate Language Model Jailbreak","venue":"cs.CL","work_id":"4364b616-115e-4a47-b881-aa06edafd226","year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.706822Z"},"links":{"cited_paper":"/paper/2404.06407","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:b5f389f2a65f8aba4ee519de8c459a7fd0b0a79f8042abcf109a974450653edb","observation_id":"37041393-4ed4-4b92-a263-8c859f7bd858","resolution":{"observed_at":"2026-08-07T05:40:20.926237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-07-06T18:34:29.513732Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-07T05:40:20.711744Z","title":"Sorry-bench: Systematically evaluating large language model safety refusal behaviors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.711744Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:cbe54cf80b2a0425ecde81eff0cccb38db4527fa23e8b516cddf1d791aaed201","observation_id":"2a7751e3-04d6-4088-b57d-1229ae8704ae","resolution":{"observed_at":"2026-08-07T05:40:20.711744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10694","last_updated":"2025-04-14T20:30:41Z","snapshot_observed_at":"2026-07-06T21:09:26.716260Z","submitted_at":"2025-04-14T20:30:41Z","title":"The Jailbreak Tax: How Useful are Your Jailbreak Outputs?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10694","snapshot_observed_at":"2026-08-07T05:40:20.716732Z","title":"The jailbreak tax: How useful are your jailbreak outputs? arXiv preprint arXiv:2504.10694, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.716732Z"},"links":{"cited_paper":"/paper/2504.10694","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:88a587497c617948f7ff768223116ee71b76df86ff5db1abf59a759a3b4f9ddf","observation_id":"a1070a30-5b1e-4ab6-992e-ec2f7ad6ff83","resolution":{"observed_at":"2026-08-07T05:40:20.716732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17436","last_updated":"2024-08-05T18:12:27Z","snapshot_observed_at":"2026-08-06T17:34:58.933900Z","submitted_at":"2024-07-11T21:16:48Z","title":"AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17436","snapshot_observed_at":"2026-08-07T05:40:20.722684Z","title":"Air-bench 2024: A safety benchmark based on risk categories from regulations and policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.722684Z"},"links":{"cited_paper":"/paper/2407.17436","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:19e68503d4913e7ded876c2dc40e18ca194edb971e878c7e778aaeb001479122","observation_id":"26835b23-1641-4939-ab42-09bdb134a4a5","resolution":{"observed_at":"2026-08-07T05:40:20.722684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-07-06T19:29:51.449372Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-07T05:40:20.727309Z","title":"Multimodal situational safety","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.727309Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:a34eb60264472cd7a7d868819d360b92be5af4522aa3a93e689ac04fc8d52206","observation_id":"2912aaeb-2854-4b65-8fa6-47bfc05b8e3b","resolution":{"observed_at":"2026-08-07T05:40:20.727309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:20.732373Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.732373Z"},"links":{"citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:f6e5828d443e6858552e6984bcc18e6abac92a7396a820007d994dd0d5ee2fb6","observation_id":"b139af91-eb49-41c9-8e53-aad5732b7f87","resolution":{"observed_at":"2026-08-07T05:40:20.732373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T05:40:20.737235Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.737235Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:c0738a2765b0e2532a57e3b14a65f81bc33ab1cce5f3401bb668945c6bd31d0a","observation_id":"19b5f8c9-896d-4480-b287-6ebff5ed5fad","resolution":{"observed_at":"2026-08-07T05:40:20.737235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23278","last_updated":"2025-10-07T07:13:32Z","snapshot_observed_at":"2026-07-06T21:00:55.979837Z","submitted_at":"2025-03-30T01:58:22Z","title":"Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23278","snapshot_observed_at":"2026-08-07T05:40:20.742100Z","title":"Model context protocol (mcp): Landscape, security threats, and future research directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.742100Z"},"links":{"cited_paper":"/paper/2503.23278","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:9e385abdf2715fc4f283d32ddc5933ee7a883cc0697389905c172ec53ceda014","observation_id":"d8e565ca-a31a-48a8-acc5-b88382c9daf0","resolution":{"observed_at":"2026-08-07T05:40:20.742100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06474","last_updated":"2024-03-04T04:03:54Z","snapshot_observed_at":"2026-07-06T16:30:25.358715Z","submitted_at":"2023-10-10T09:44:06Z","title":"Multilingual Jailbreak Challenges in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06474","snapshot_observed_at":"2026-08-07T05:40:20.747279Z","title":"Multilingual jailbreak chal- lenges in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.747279Z"},"links":{"cited_paper":"/paper/2310.06474","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:c124703fef812b6facc83ccd0596e55a23e76ab5dfb4de29afa6503f5a256a6b","observation_id":"f9ee1f79-47cb-4735-aa43-bfa24bca4413","resolution":{"observed_at":"2026-08-07T05:40:20.747279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-07T05:40:20.752585Z","title":"claude-3-7-sonnet- 20250219","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:20.752585Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2506.07402"},"observation_digest":"sha256:0aaa5dd76cfad451954d4918e3b3108428bcfbb6b4bef15c1845cad14408745b","observation_id":"c549df12-5d4b-49ff-9913-808afde46e72","resolution":{"observed_at":"2026-08-07T05:40:20.752585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07402","last_updated":"2025-06-09T03:52:43Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-07T10:07:41.500171Z","submitted_at":"2025-06-09T03:52:43Z","title":"Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2506.07402."}