Pith. sign in

Paper Citation Record · LEDGER

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

As of 4 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 72 inbound Pith citation observations for arXiv:2404.01318.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2404.01318 v5

Coverage vector

measured 64 of 64 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-15T06:08:05.386345Z

measured 136 of 136 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-04T06:34:03.388597+00:00

measured 72 of 72 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-02T11:28:36.924563Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-10T06:15:00.866473Z

Reference resolution

64 of 64 outbound references displayed

  • verified exact35
  • verified fuzzy20
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch9

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f52f41d0-e120-43c0-9c46-915c932a32de · outbound

This paper cites Get my drift? Catching LLM Task Drift with Activation Deltas.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Get my drift? Catching LLM Task Drift with Activation Deltas

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.444361Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:6b16c133d2b4c8e77c6c920653d46aa7203ee1d4979eb6edc12c93b7104d23ed

Observation cb1a5952-78e4-43b9-9b13-f69f8f2895d1 · outbound

This paper cites Llama 3 model card.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Llama 3 model card

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.685711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:b1e7070df4ebbb6b02787d398619eedf62039cebaf98ad9ea879c063cbf99f0e

Observation ee1558a9-17a5-4cf4-b065-2372b912e852 · outbound

This paper cites Croissant: A metadata format for ml-ready datasets.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Croissant: A metadata format for ml-ready datasets

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.438566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:5e9a0582a1bda514dbbdde50ffd0ec02bf3d0dffb8d6d0ca02721dc58c294619

Observation 94d4132a-2e54-4831-b5a4-1a3ff306350c · outbound

This paper cites Jailbreak chat.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Jailbreak chat

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.726947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:681199739aa6ac55531eaf93dae29137ca543e1bb994425f97d1d21c1f95e220

Observation d81435c3-e78d-408d-8c71-d1a8023331eb · outbound

This paper cites Detecting Language Model Attacks with Perplexity.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Detecting Language Model Attacks with Perplexity

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-15T14:02:27.073914Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:f7ac291c7f0c1c6da34fd7a1491f31b5e9760e0bd2093cb77603e3e3d07a196c

Observation 9b4695f0-3376-423e-ae6d-b5f91e084b40 · outbound

This paper cites Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.456157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:ece2a4c208d3b94f55bc5580890d39bacaf0712dbd9034f9bdad34f15c51acff

Observation 9bf1517d-d7fa-42a2-885c-0c52dff62180 · outbound

This paper cites Refusal in llms is mediated by a single direction.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Refusal in llms is mediated by a single direction

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.663847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:4dd392cda056aafae7aaebdd620925b8dcd17158fa3a9fca951841c1bc8e5ca2

Observation d1a78591-99a7-4ff0-b1ad-6a855965ff3b · outbound

This paper cites Are aligned neural networks adversarially aligned? Advances in Neural Information Processing Systems, 36.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Are aligned neural networks adversarially aligned? Advances in Neural Information Processing Systems, 36

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.667623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:55e5e8d7876ba6143e5e93222a2db4c2bb323dc7b5898b96ae46d0f6476699a1

Observation 417ae944-6027-4753-b94c-3d629d48b954 · outbound

This paper cites Non-determinism in gpt-4 is caused by sparse moe.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Non-determinism in gpt-4 is caused by sparse moe

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.671523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:b2e3ec37b570f91e51a292bac4a6a2c2d98be1c70243e5551e80ec6a6466754a

Observation da0555d9-a6eb-406c-a06b-f113cc3ac3ff · outbound

This paper cites Jailbreaking Black Box Large Language Models in Twenty Queries.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Jailbreaking Black Box Large Language Models in Twenty Queries

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.570098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:5e3705facd72c7fe0a4e136ca8a582206742a6794008486e1c7626039f4c114a

Observation 7beb1d43-7e0f-4423-9e8f-cbfbe07a1595 · outbound

This paper cites Robustbench: a standardized adversarial robustness benchmark.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Robustbench: a standardized adversarial robustness benchmark

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.679134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:ea542e63c5cfcf3dfffd65fc4f02f45dc6fd4ccd8ca2f86d76e0865ad6332a9c

Observation 9bde5b79-fc98-4f7d-bd61-96df390e823c · outbound

This paper cites Multilingual Jailbreak Challenges in Large Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Multilingual Jailbreak Challenges in Large Language Models

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.575886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:adc29502c4c621eeaf99a3499dd37641a8e8fa22fdc07333ae7f28ba6f9f2a51

Observation dcd6d2d5-77a7-4685-a090-86134a0fa128 · outbound

This paper cites Attacking Large Language Models with Projected Gradient Descent.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Attacking Large Language Models with Projected Gradient Descent

Reference 13

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.581194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:32e6b9de85e9233a0d575178badf6d3bd7461c2646d711dd4cc9f5297acbc4e0

Observation 40a44745-888d-4f5e-8e58-53bfc3307b1c · outbound

This paper cites Gemini v1.5 report.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Gemini v1.5 report

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.688548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:605d6970c45fb344df0740efb7b651ab9c8c56f561601a7e3a167698e85695bb

Observation 3d40c8bc-92e7-45af-9a9b-13b4450f0166 · outbound

This paper cites Query-Based Adversarial Prompt Generation.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Query-Based Adversarial Prompt Generation

Reference 15

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.586412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:799a4e2d6f5910556f4743f5b97e5b9adfa9d0e09b3fdf05d47969b19196cbb0

Observation c80d48f4-6846-45c8-be08-ffe06c6a00fc · outbound

This paper cites Measuring massive multitask language understanding.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Measuring massive multitask language understanding

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.694129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:df53c76fe72d36b5d516a6a75face7ab688babc25ebb8c2f035757d43dab9393

Observation 451e27d6-fd76-4838-a4d0-ac044ccecea1 · outbound

This paper cites Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-16T22:00:51.596826Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:d2db26abbbe58fb22f4cdad2a4ee5e132a3dfc33b192c1d80c399cdb43304b3e

Observation 14eda907-262d-4a5e-9978-ccab91d7815c · outbound

This paper cites Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.597327Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:881a99b011a4f2d6f444498d1fae9a0d720c2e4ab68922c01aa5bd7bac6ab35a

Observation b032a506-52d4-41cf-8c2f-027640a9e8d0 · outbound

This paper cites Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.602244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:56de424b4871f573fe710f8605058640e89249d17cb1e15cc9552e99333aa0fd

Observation 7788ce21-f353-4643-aa33-3dfeb7d0fc56 · outbound

This paper cites Baseline Defenses for Adversarial Attacks Against Aligned Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Baseline Defenses for Adversarial Attacks Against Aligned Language Models

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.607273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:2488adf7435de251dfc505e99f8edec08c1b35826e63615e5e7a19cf87b18cc4

Observation 658d527c-31f9-449c-a5a1-f82f5704d7a6 · outbound

This paper cites Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.612858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:d5d2bb8e029018449e8ee5c0da28bcc2ff0e63a47faab001a4bfc8a31a8903bb

Observation 31ddbe07-947e-412c-b49b-1f4779586d60 · outbound

This paper cites Mixtral of Experts.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Mixtral of Experts

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.617244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:05111bcd0b85cf91caa9785db46c6e36478c934a15e56b139244000854bf1942

Observation a44d343e-a3e5-4c9b-ab65-b7f13694d76f · outbound

This paper cites Guard: Role-playing to gener- ate natural-language jailbreakings to test guide- line adherence of large language models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Guard: Role-playing to gener- ate natural-language jailbreakings to test guide- line adherence of large language models

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.622523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:6355089b4485a3c67ae13fc3b80d54b5187f0d312c5b116940739b9bd45e232d

Observation 33ea019e-6694-4774-9866-fa52758af9d8 · outbound

This paper cites Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Jailbreaking Large Language Models Against Moderation Guardrails via Cipher Characters

Reference 24

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.627014Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:9eef79fe57217abc6beb129d67acdee8d8c1922c4a842f03d6e9ac199bdb5c10

Observation 16e16c7d-57e5-4dd9-933b-72ca8b2c757f · outbound

This paper cites Certifying LLM Safety against Adversarial Prompting.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Certifying LLM Safety against Adversarial Prompting

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.632731Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:746c7e74ad99c8b837a1c7a4d0ca9526cb6d5b4c6c03cf6377837cbda9da0679

Observation fb3e3ded-af34-448d-8780-349c26f73a04 · outbound

This paper cites Open Sesame! Universal Black Box Jailbreaking of Large Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Open Sesame! Universal Black Box Jailbreaking of Large Language Models

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.637785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:56f1a08d96a8b2b5c1c746b0ea981663e08546e9dea7e30c22effbca3f0f4f11

Observation 31495855-5314-410c-8106-de760bbcf6a0 · outbound

This paper cites No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models No Two Devils Alike: Unveiling Distinct Mechanisms of Fine-tuning Attacks

Reference 27

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.642615Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:4f2ec87229bf23c2faf6c1b12d8c0232e9e43558636f95730b43dd1cc974d95d

Observation a0d6b3d9-7464-4d49-b2f3-9795af098f09 · outbound

This paper cites Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment

Reference 28

Resolution
metadata mismatch
local_arxiv, observed 2026-05-15T06:08:05.648088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:79de8d5b46b9d5a525a6aff36f4e17c371a34d749d2b9db730851d97dea806b0

Observation b118c386-e631-48ca-8459-6e07acba552c · outbound

This paper cites AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.653882Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:7f89ea23a5923bf8fa8a316141907c44f1b4a8ab2d6edd23000880275d6458bd

Observation 8a6c4c2c-2e2e-4cb7-b988-2080a4f31622 · outbound

This paper cites Meta llama guard 2.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Meta llama guard 2

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.691379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:3a5493e53c45869f4948915985dc5ef9aad90b38b1811e6e59ce6aaf1003ff34

Observation 45f7aa29-0ab2-4c31-9a8d-31433899d91b · outbound

This paper cites A Safe Harbor for AI Evaluation and Red Teaming.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models A Safe Harbor for AI Evaluation and Red Teaming

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.659825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:68895d7dd44b808840805ef5a09f7e479a73a81dbd25f565ffe57bdbb5e287e4

Observation 9bfff335-1225-4dce-97eb-3a26d5ea0ddf · outbound

This paper cites Tdc 2023 (llm edition): The trojan detection challenge.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Tdc 2023 (llm edition): The trojan detection challenge

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.701347Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:d9d74eccc066afcb7ac424b906447b9468c76feb19106559e8913d16848db156

Observation 3c79fc6c-f265-4f5d-b91e-c3e8048bca3a · outbound

This paper cites Harmbench: A standardized evaluation framework for automated red teaming and robust refusal.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Harmbench: A standardized evaluation framework for automated red teaming and robust refusal

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.705246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:ff9b090ed59a3985bd39ea855c47a26358ab255ccf627597ab2f8bd1d100363b

Observation bffd8101-d2d5-4ae8-9420-54b5c1f107ca · outbound

This paper cites Tree of Attacks: Jailbreaking Black-Box LLMs Automatically.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Tree of Attacks: Jailbreaking Black-Box LLMs Automatically

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.461377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:caae9b3e2dabf8e75e719e903aba217fd20b0561d3341e9e340b9cb584a44e84

Observation a2126e21-474d-4b40-8e67-9f28780539d3 · outbound

This paper cites Jailbreaking chatgpt on release day.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Jailbreaking chatgpt on release day

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.712531Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:91a8a90f64f7ba6f174edf230b4fa70eb248464220f28bdb4cdcc096ec5aa415

Observation 5d217870-48bb-43e3-87be-b43a47a455b0 · outbound

This paper cites Gpt-4 technical report.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Gpt-4 technical report

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.715713Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:260d246e88bfd614f0d0b2a33735404206f39ff201635c222da709d9a5856180

Observation c58914f9-d266-4329-95f3-1ef7b40de8a6 · outbound

This paper cites Training language models to follow instructions with human feedback.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Training language models to follow instructions with human feedback

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.719739Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:027363a92be97a4a8526178ad50843aad2637dfcbb7908b4e9a3d96fdb600aaa

Observation 3fc94b89-7722-488c-879c-72aaac5fb5a5 · outbound

This paper cites Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Navigating the Safety Landscape: Measuring Risks in Finetuning Large Language Models

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.466259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:3e5a3105e1b48afd024e5ae30c8d5592403a476b887a18bb1a266cfd276a56e5

Observation 3929f72f-23df-4171-9470-f4b591b75320 · outbound

This paper cites Data cards: Purposeful and transparent dataset documentation for responsible AI.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Data cards: Purposeful and transparent dataset documentation for responsible AI

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.427622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:61e6e100f1618463088207e3a8b9445b4785bbba784f17d4f2e224fe35fd6b34

Observation b34c67f1-8831-4f45-8438-78bf9ed89230 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Direct preference optimization: Your language model is secretly a reward model

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.730468Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:9f2b73c3e1c0f96b32fb7f84855f92147f6fd4091984bbd81fba62dc73fd5fb6

Observation ff2b8742-5521-43d0-98b1-c4b11784e2a7 · outbound

This paper cites Find the trojan: Universal backdoor detection in aligned llms.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Find the trojan: Universal backdoor detection in aligned llms

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.675608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:7a493b16a7c2fed4810c7c72da0519e33999739dfc5777ad1ca69db58fe87223

Observation b36fc692-d441-4a74-9449-ac3b1f0142f5 · outbound

This paper cites SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks

Reference 42

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.470017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:09b6003a20edf2c7bef5f5ae9b3a35bdde089c140a8486c8cca00cf1a9fef440

Observation 7237c79c-3056-4b6e-b8e6-30e9f9d775f7 · outbound

This paper cites XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:51:50.894684Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:6b3ca2a3c8cf82d0a7e07e9cd465b0154d1e173a57429f25ecfd5eff56d3012a

Observation dc4002bc-dea2-4b34-b549-7dd66ece4c54 · outbound

This paper cites Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation

Reference 44

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.480000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:4d7bfd47ea9df671db17aa7cc98daaf717f6cb3dc11d555c4d115553764b464e

Observation 833ebf27-235d-4fa6-bc7f-aaa37c8388df · outbound

This paper cites "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-05-17T08:39:28.464962Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:091c73000d1939ffc980e23ca73b218ddbec441595dbdef5b7a4aa966321af0b

Observation efeb32c0-20bc-4c05-ad0c-89ff25a44a81 · outbound

This paper cites PAL: Proxy-Guided Black-Box Attack on Large Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models PAL: Proxy-Guided Black-Box Attack on Large Language Models

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.491124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:36e76b490f51d9d14dd439771139f678c7e0f673e9bb6e6569392f15a8942fd4

Observation 284f8814-55c9-49f3-9e3c-8d83492214e7 · outbound

This paper cites A StrongREJECT for Empty Jailbreaks.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models A StrongREJECT for Empty Jailbreaks

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-16T21:28:03.016512Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:6fb1c22a7731ed8879b0820ba5be1333ab952faea6009fdb464016d87cd2cd99

Observation c84f9851-26ab-48ce-b16e-6f4d66ed3a5c · outbound

This paper cites rspeer/wordfreq: v3.0, September 2022.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models rspeer/wordfreq: v3.0, September 2022

Reference 48

Resolution
verified exact
doi, observed 2026-05-15T06:08:05.432681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:68c089e588c2182bb0b9b767646865bbb995b271427a094eac2ce3c411b4b447

Observation 8853d8da-4b81-4463-9835-b3e09969d32c · outbound

This paper cites TrustLLM: Trustworthiness in Large Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models TrustLLM: Trustworthiness in Large Language Models

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-05-18T11:17:09.209714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:ef9edcd7b423dbc1e64a166898ee51c6d45975aecb6bcb7e2dbda35f8dc6e38f

Observation 2fd99d61-5f03-4179-af26-52f2835ae67c · outbound

This paper cites All in How You Ask for It: Simple Black-Box Method for Jailbreak Attacks.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models All in How You Ask for It: Simple Black-Box Method for Jailbreak Attacks

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.506841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:b9ac471228b945b6e411256a45481d30e84cfba44b8d0ff84402fef1470132cb

Observation a7055a67-eeeb-42a5-9f83-6ec12526dfe2 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 51

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.512899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:0d7ca837ad363e651c30b7d5c9e3746e301fac86e4d13b086e39233c863b771c

Observation a6b6c1ac-60f7-46fa-ac89-64db8add18bb · outbound

This paper cites On adaptive attacks to adversarial example defenses.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models On adaptive attacks to adversarial example defenses

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.682254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:05b4fc09e25dba1c40663b9b7294a4b294efc752172b3d16018d2bcfedda4430

Observation c0a376a6-5313-4c1c-af69-d16230f11a23 · outbound

This paper cites Decodingtrust: A comprehensive assessment of trustworthiness in gpt models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Decodingtrust: A comprehensive assessment of trustworthiness in gpt models

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.697673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:3096df73a5c6854573808b924ed5614668593bdacc9a61016e51186a19b61266

Observation d156a89d-0465-4b93-ae09-3e03a56b44f5 · outbound

This paper cites Jailbroken: How Does LLM Safety Training Fail?.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Jailbroken: How Does LLM Safety Training Fail?

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.518550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:95f0361bb0415577b35553eb3f5c073cc3955751a616085de425a266570f897b

Observation 0f73f005-c433-44cb-baeb-4072e24ebefd · outbound

This paper cites Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Defensive Prompt Patch: A Robust and Interpretable Defense of LLMs against Jailbreak Attacks

Reference 55

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.524282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:79fa55b04c4fcb08d32f927ff75b954dca237901136267332e46a808069ee344

Observation a0946d21-1906-4376-9f24-de60bb06111f · outbound

This paper cites Low-Resource Languages Jailbreak GPT-4.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Low-Resource Languages Jailbreak GPT-4

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-17T09:24:14.203470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:e1323be9cdfb095e2dde0690cf40c6004560c5b39bec9f9e868d6c08365c639c

Observation 96bcb434-7eec-4492-baa4-e5f9794dc5b8 · outbound

This paper cites GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts

Reference 57

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:25:21.318009Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:cd5e0c229484a7c80bb79246d2d19339acd008bb8c30514d1bc1709a1219bfc9

Observation 68191e5e-ce2a-46cf-8c6a-d91f943006b8 · outbound

This paper cites How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs

Reference 58

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.541412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:17ea48c50756015dfd779e218241026f1cd5246ad21da1b413ede4f9248f5eca

Observation cd42278d-1978-49f0-81df-f7c053c8745c · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 59

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.546872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:41306c0b87a369b50b70addf79e9b52b8732cf8f66116519a25dfdc665ca84c8

Observation 173496f5-42e2-412e-8760-c37a1c4e3b2a · outbound

This paper cites Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses

Reference 60

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.552383Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:1ee826a45dbf4abf2cdef89f5a70e15e2218801155e42d25059246eee6a9c2b8

Observation 4d2f9c08-7a01-4d35-8d50-72dde00b0070 · outbound

This paper cites Easyjailbreak: A unified framework for jailbreaking large language models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Easyjailbreak: A unified framework for jailbreaking large language models

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.723038Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:865cb4ecc0701535cb336345c3e611fc9270fe7128954b4eade4e12597db33c1

Observation acac4324-7306-4d43-9b7a-3ea2b6ec88c4 · outbound

This paper cites PromptBench: A Unified Library for Evaluation of Large Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models PromptBench: A Unified Library for Evaluation of Large Language Models

Reference 62

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.558387Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:7d74fae69fdbc62a2dc020cbb492abfbb14795fe01b999589f7f14d5c57b0a7e

Observation 3e62f120-2cb0-422e-8411-1b95f80c2164 · outbound

This paper cites Randomness in neural network training: Characterizing the impact of tooling.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Randomness in neural network training: Characterizing the impact of tooling

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-15T06:08:05.708945Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:f16f06da2f63d9bb395b08aa3b22fadcb6894bff582ddc884ce2f5aaa619a2ad

Observation 7149086c-43aa-441f-a801-7da49abfc2b1 · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 64

Resolution
verified exact
local_arxiv, observed 2026-05-15T06:08:05.564496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T06:08:05.386345Z digest=sha256:ba8aa8164979dff62e211c85271662252b8cc2aef7fabe49714d3480c03eec0c

Pith citing papers

Observation 736b4907-b5e0-4fca-90de-b86831e13603 · inbound

SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks cites this paper.

SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-14T17:11:00.639293Z digest=sha256:ce42ff9d2dff2d414e7b2c8f8e90dd1030fee9e1d3d9509dbfc6d190cdc9efc2

Observation ef279a91-5b56-4443-9ddd-2b03cf6f69ec · inbound

Jailbreaking Black Box Large Language Models in Twenty Queries cites this paper.

Jailbreaking Black Box Large Language Models in Twenty Queries JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-12T09:48:31.721745Z digest=sha256:21066dcc9d903505457a9270c6d487c36a2ce040ea31462fbdfd05064fc9ee30

Observation a7615531-d699-43a3-87eb-d6eb25649be6 · inbound

Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment cites this paper.

Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 5

Resolution
metadata mismatch
local_arxiv, observed 2026-05-24T00:38:39.944388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-24T00:38:36.992597Z digest=sha256:897ed8a94d77284e7bed1161b3c658e29a9076b269d2157e60492231b09b8c90

Observation 15889308-8cd3-42ee-945f-63187997ca26 · inbound

Refusal in Language Models Is Mediated by a Single Direction cites this paper.

Refusal in Language Models Is Mediated by a Single Direction JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 125

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-13T10:47:55.934081Z digest=sha256:b71b5b076d0f73b014f38081134d31656d58a92b4077447f7c6af423013b351d

Observation c452888b-062f-401a-a538-ab96428606af · inbound

AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents cites this paper.

AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-13T06:35:13.331872Z digest=sha256:d94de44422765d1a984abb137659e9a5e5ad73f88f91a112524e09612c0ea430

Observation 5ab867da-47a7-42ec-9042-3f5602e63487 · inbound

Jailbreak Attacks and Defenses Against Large Language Models: A Survey cites this paper.

Jailbreak Attacks and Defenses Against Large Language Models: A Survey JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 14

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-15T02:20:44.368219Z digest=sha256:cbbfc1e738e70eb9c6586b0c7bfcd1e3837ce896d4e919b0499543cbd910ca30

Observation fff050ba-7da0-4e09-aaea-b532e5d65909 · inbound

Towards an AI co-scientist cites this paper.

Towards an AI co-scientist JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-11T13:02:43.571234Z digest=sha256:f28516edeba25ef30f14f22a44a213f910a0821686ebc47bf7ce8c143fad353e

Observation b2b82c4a-c28c-47cb-8cf8-5072e7649a91 · inbound

LLM-Safety Evaluations Lack Robustness cites this paper.

LLM-Safety Evaluations Lack Robustness JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 15

Resolution
metadata mismatch
local_arxiv, observed 2026-05-23T01:27:21.410326Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-23T01:26:45.402983Z digest=sha256:7e46f88e62f88663034c149edb897f79f28b0ce342c33f43522ccf476602fa28

Observation 21ba870e-7a51-4253-8388-64336df98c6b · inbound

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction cites this paper.

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 76

Resolution
verified exact
local_arxiv, observed 2026-05-19T11:37:15.968494Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-19T11:34:09.428653Z digest=sha256:d0781ce35d1a21265070d1a4efa1a2f69a5ddb894425e0be2a1bfc4f8b7ef60e

Observation ec31f092-06d9-452c-85e0-cb5a72982d5b · inbound

Benchmarking Misuse Mitigation Against Covert Adversaries cites this paper.

Benchmarking Misuse Mitigation Against Covert Adversaries JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-05-19T10:32:14.772620Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-19T10:29:05.104520Z digest=sha256:6556974d1b4d2a5bf3ea27ccc27d9665210466a434e6d81424a54467e41fad14

Observation 188b5b7c-8df4-4b34-afa0-46230752edd1 · inbound

Exploring the Secondary Risks of Large Language Models cites this paper.

Exploring the Secondary Risks of Large Language Models JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-05-19T09:42:14.017160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-19T09:40:58.067398Z digest=sha256:8cb2b7b149c677144d79553bfced838127b5cf2d6a080e7b035731f38f2f3420

Observation b18139b3-ea4d-47f2-b41a-9af74acd4a7f · inbound

Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions cites this paper.

Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 36

Resolution
metadata mismatch
local_arxiv, observed 2026-05-19T09:32:16.265856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-19T09:31:14.739478Z digest=sha256:037d5f1d019e75290da3873030e2cc92774efae28964e05ba2c533b398b6f20f

Observation 0c0e9a8e-ef58-4775-971c-215f29c4fbe4 · inbound

PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking cites this paper.

PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 8

Resolution
metadata mismatch
local_arxiv, observed 2026-05-19T03:37:01.127676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-19T03:36:24.013477Z digest=sha256:82b1f0b2d0e786fbc8f4ed7a76489b7d30c36fd5b71f7be5f90e15d21eac9389

Observation b543987c-e8c9-430d-aa1e-8975058769ab · inbound

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs cites this paper.

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 49

Resolution
metadata mismatch
local_arxiv, observed 2026-05-18T21:36:52.424978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-18T21:34:51.665401Z digest=sha256:75f8c7fa18d10e8be6623c5158a9d2ed2576f3d92dd3c535f812d766144f204e

Observation c20169ec-ee12-4d83-bc0f-bf6649120d5b · inbound

Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs cites this paper.

Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-05-21T19:00:30.437810Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-21T18:58:53.183734Z digest=sha256:af46aa14db23f9656dd510cca2059b1ab2127174553816552b6792e976d195b0

Observation 6a74452a-f481-454b-817a-f45949213cb0 · inbound

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing cites this paper.

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-05-16T08:17:36.584855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-16T08:12:55.296932Z digest=sha256:2393bf905298be2aa4dbac7058f09ade81f18867ba9efcbdc42af9dea1e6b72f

Observation 95a0c614-b100-4c64-9f6d-785081bb9788 · inbound

Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks cites this paper.

Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 9

Resolution
metadata mismatch
local_arxiv, observed 2026-05-21T12:10:06.517424Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-21T12:09:55.500940Z digest=sha256:a949ddc88f5803e1df06047de0940b444ece3036066dbb90bb5532a5f62eb8d8

Observation 640ab874-88a9-4497-84cc-02a1e7f29afc · inbound

Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI cites this paper.

Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-05-22T10:21:23.284052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-22T10:19:56.003219Z digest=sha256:0c99e2cc9f84901d331c7b7b668396938e1e9005a7742a5ab2a183a23fed5930

Observation 9656a927-5e86-4fc7-ae79-c0f9df2fe9cb · inbound

Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints cites this paper.

Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-10T16:04:25.851592Z digest=sha256:dd06c1ac4ecaffc9ff621df221a7e92a1325767738a90cd0a1ab98030235b5eb

Observation 5913a7a5-0bfd-4539-8240-ae5dd5d2e9c3 · inbound

HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents? cites this paper.

HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents? JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-10T10:32:37.967401Z digest=sha256:ef5e59a60820691fdf7adb1bcda754a17ba60eced4eb55de476cc151fb972b5e

Observation 45c4931a-d2f8-416b-9494-1290ce298a57 · inbound

Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs cites this paper.

Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-10T09:10:55.001543Z digest=sha256:a62998cc312bd1110816ef2772e2f463d764b00dfa814d31dfa403f0f119341e

Observation 3de037b8-8ca6-4efe-97c7-c810f9f109f6 · inbound

Auto-ART: Structured Literature Synthesis and Automated Adversarial Robustness Testing cites this paper.

Auto-ART: Structured Literature Synthesis and Automated Adversarial Robustness Testing JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 34

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-10T00:39:43.196010Z digest=sha256:6a65f52a68c77cdfdcc83be9e1173314e1bac982839728b18afdf4363a052e43

Observation 7aaa065d-ac00-4aef-93f9-4a67a2a32e69 · inbound

Cross-Lingual Jailbreak Detection via Semantic Codebooks cites this paper.

Cross-Lingual Jailbreak Detection via Semantic Codebooks JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 3

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-07T16:22:33.567085Z digest=sha256:8fad28315126342a438c42bab49a532af723811029b4289a3b7b148046af9114

Observation 1a40f51c-ca41-46c5-94ae-218c4664c54a · inbound

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models cites this paper.

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-09T14:24:48.999632Z digest=sha256:7fff01066085f3375a410eda866ec24c865a34cdf229d1f1137b1afa116048c7

Observation 12749912-0b75-439d-bd32-c1892a2bfcbc · inbound

ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming cites this paper.

ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-08T19:16:21.173184Z digest=sha256:979555da1cd4951a583b38fa14882dedb3e2ee3a4d666d50e3bc0ea7e2fd9b7c

Observation 2802f773-6c62-483d-a66e-9b88b83f1333 · inbound

A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts cites this paper.

A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 23

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-08T18:11:29.066362Z digest=sha256:625f1d35a699cd3557f9deff2f262e8bc1b6a55e8d79a2daa78f6c5a5866b9e1

Observation 783c5c1d-617b-4136-89f5-e38ddec24337 · inbound

The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring cites this paper.

The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-12T02:42:08.565972Z digest=sha256:32f44374a6bf35369418269f44f3cba46f6259b9fce89eca8d4675c4c741b6e1

Observation 49bd45b7-5000-41f2-bcc6-aa51cf3ce9bb · inbound

Re-Triggering Safeguards within LLMs for Jailbreak Detection cites this paper.

Re-Triggering Safeguards within LLMs for Jailbreak Detection JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 3

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-12T04:37:29.075413Z digest=sha256:3f564bd8821fe457fa69d528f7681008b92f1ae09d77ce236e17fc242275c08f

Observation 7f3563fe-3be0-4759-952c-daa96002b875 · inbound

Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks cites this paper.

Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-12T05:28:45.453455Z digest=sha256:cd6e32e5b1794a417fb111b71ee77f0295c9df6b41e0c43df21ce3263c027646

Observation 5ed8836b-364b-4656-8bbe-c6e3b5b5a408 · inbound

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance cites this paper.

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 80

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-13T07:03:14.415745Z digest=sha256:053117190d3bdb78e0e029c54bef7920dc6b7a387d284df166db5380caea98e2

Observation 7cb2d2f7-bc78-45f5-a7ae-87f5114946f0 · inbound

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study cites this paper.

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 26

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-15T05:11:47.070579Z digest=sha256:6d88f7c5e4b51376bf4d7390f78df8b9dcb67bf2fcf377a6a59dfcfe0586c1a1

Observation fb77849f-cbaa-45f3-9453-36e4b42bb3ec · inbound

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study cites this paper.

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 26

Resolution
metadata mismatch
local_arxiv, observed 2026-05-19T13:42:19.205489Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-19T13:41:37.102367Z digest=sha256:656a7d6475fa62b839358581aaf38a06a0b8b3718b0fdfcd151b7c76c80915a6

Observation 6c2311cd-0ea6-4e5a-a17e-6df56a8eb3e1 · inbound

The Great Pretender: A Stochasticity Problem in LLM Jailbreak cites this paper.

The Great Pretender: A Stochasticity Problem in LLM Jailbreak JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T06:08:05.732086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-15T02:09:42.090550Z digest=sha256:b9e67d1c5939dfb87afd6e62a03b3dfa7b79aa2d0ac0f07b2ca31c74bc91606e

Observation 5612550d-065c-4012-b7c3-24a25892b71b · inbound

Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications cites this paper.

Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-19T23:32:52.506793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-19T23:30:43.364230Z digest=sha256:928a5be51195b8df3eae0f2e8e48e55cf3275c5ea5c64900c8aa367519a464fe

Observation 6cf384c0-cb63-46c8-9c44-198fee815f5b · inbound

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs cites this paper.

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 6

Resolution
metadata mismatch
local_arxiv, observed 2026-05-22T09:41:22.319627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-22T09:38:04.387777Z digest=sha256:039042150a3cc6c99942d787f2cd5ec564142bd824f386b4797ac6e4945e39be

Observation 324585d1-1310-4d6c-9531-4ff33678dd68 · inbound

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs cites this paper.

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 93

Resolution
metadata mismatch
local_arxiv, observed 2026-05-22T09:41:21.339259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-22T09:38:04.387777Z digest=sha256:9618e45891a00f110618d05384a98c8f4b04f86cd079979dacc67b6ac3039444

Observation 40d4c4cf-b8b7-47ea-9721-90088215b7c9 · inbound

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs cites this paper.

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 7

Resolution
metadata mismatch
local_arxiv, observed 2026-06-30T17:34:58.051793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-30T17:17:39.899234Z digest=sha256:04f266c4f4a3d6812bafb827e14b3736bcfa02e7eac5732f731c4d3ed29407fe

Observation e3fbea9c-17fd-4419-b0a4-15ad4358f958 · inbound

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety cites this paper.

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-05-22T05:51:07.923143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-22T05:50:28.114140Z digest=sha256:107b8304d8bf3072e411844f6559f9910c4ad6a05d3c136f44216701705b0d17

Observation 6ef608f6-771d-4bfd-a158-0b6d5f2e75ec · inbound

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety cites this paper.

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-05-25T06:06:42.840186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-25T06:05:27.736494Z digest=sha256:c4f0dfced3bcdd61d3a61315da399b3378d8a6f5bca084e639b499d0009eada3

Observation c110e024-d0e0-4f0c-8d21-631bd3cb7966 · inbound

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection cites this paper.

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-07-01T16:35:50.615443Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-30T00:29:50.433221Z digest=sha256:f58451f9e6c9971c23364b932b24319e658657ff425653982fd3f4cdd13dbe7f

Observation 7d61bd6e-857a-4946-8f94-16e1b8b53144 · inbound

KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models cites this paper.

KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 16

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T18:03:48.070188Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-29T17:57:17.196238Z digest=sha256:e4d9c5257f99c71fe547d64afac4852605dc37bbcfa5534dd1293e7fb7fba973

Observation ab32cb81-8744-43b7-a190-90f5a0523053 · inbound

A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving cites this paper.

A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-06-29T18:03:47.837889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-29T18:03:19.798168Z digest=sha256:cb42658996ff14e285a6b5affa36a45543a2c1c4fa7b58dd33e1c19afa2f7a34

Observation 29bc340b-f5b5-44fe-8ab8-a844ececf74d · inbound

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content cites this paper.

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 5

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T09:13:15.969429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-29T09:11:58.843585Z digest=sha256:b0faf0009140afc5e5c0fda15b557387dd74b7982e1984634c602ccdff0617a1

Observation c316a4e2-ddb7-4865-a679-617e309600c7 · inbound

Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing cites this paper.

Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 3

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T23:56:23.247991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-28T13:49:47.542697Z digest=sha256:0b362eb8b482b89c1b395777ae935a9cdd2c117660b8d6343572a7bde1ad0ab0

Observation ee365955-ebf4-4515-8c1c-e285444838a4 · inbound

Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs cites this paper.

Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-07-02T04:16:34.640693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-28T09:21:57.373862Z digest=sha256:ddacf99a202a46953e2cd5cc80a1b99a44c747a6506dac97f5d2862782d5fad7

Observation b284dd0d-abb8-44fd-adc5-57946ee1f585 · inbound

CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning cites this paper.

CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 30

Resolution
metadata mismatch
local_arxiv, observed 2026-07-02T12:06:55.607640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-28T02:34:26.334078Z digest=sha256:5e2855dcbb9369a2108aef1337e5c74d284d85677d856a799846221526cf6fe2

Observation 7430cfc7-f41d-4e28-aaf8-40807958bf57 · inbound

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective cites this paper.

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-02T20:57:23.064073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-27T20:04:17.744876Z digest=sha256:0a0ec264fec820c3be5d402f30c9c0604a162081857665432d2f30a100cbf9dd

Observation c8d847ec-ba2b-4617-b94d-5dd9a67b491d · inbound

Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges cites this paper.

Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T00:47:30.706422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-27T17:01:03.040933Z digest=sha256:5ef8e619c65d7bc50f7b5c302ffdded3d2d049ff4ee296e81361ffe58394858f

Observation 7c61749f-eda5-4a08-b1d0-e7e61b64a4be · inbound

Distilling Safe LLM Systems via Soft Prompts for On Device Settings cites this paper.

Distilling Safe LLM Systems via Soft Prompts for On Device Settings JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 61

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T00:27:29.245408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-27T17:15:51.375580Z digest=sha256:10f38d01487918162a490794e9edc65250b50c58cdcd3984a2f8bc2b67a4e5da

Observation a0955196-fff3-4f3c-a973-95563ff3016b · inbound

Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation cites this paper.

Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-03T04:37:37.325544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-27T13:45:13.320426Z digest=sha256:c4f43948d42501019ebd976a0a1035b3dc87cdffab7fa8aa8c8e6cafc50b9f1e

Observation 76dbe284-4cdd-4ae6-a7fd-abc69ec21a1f · inbound

Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation cites this paper.

Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-06-30T11:24:38.481668Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-30T11:15:21.946819Z digest=sha256:64b2012bc5c7cc9fa262e1c5b2d08e95c59510b7a5477ec4981c5e79d737d6ed

Observation d5787c4c-f09a-4619-9675-1039ec350766 · inbound

Efficient Safety Benchmarking via Item Response Theory cites this paper.

Efficient Safety Benchmarking via Item Response Theory JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-07-01T15:55:48.966799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-07-01T15:51:00.484343Z digest=sha256:db5f1251deac286a7828225845037e01e27c7b73f1b79385f89357c6ced55b8e

Observation 916a4ef1-cd9d-4d22-aec3-6f0c09160399 · inbound

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs cites this paper.

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 23

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T09:29:44.263208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-26T09:52:52.603708Z digest=sha256:388a97dee8aca0bb4216d950c6310193b1dba7267747123dbf5a8f052565734e

Observation 8f5ed0c7-8161-412a-b29a-7f02a07eb5d0 · inbound

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs cites this paper.

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 23

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T08:45:35.634487Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-07-01T07:07:45.177242Z digest=sha256:5c83dab48b1c0a0524f42989613490e79ee9946e4a1d090038c9957f8a863f09

Observation 7986c6ef-7d42-4ceb-899b-7ba5270bce65 · inbound

Evaluation Awareness Is Not One Capability: Evidence from Open Language Models cites this paper.

Evaluation Awareness Is Not One Capability: Evidence from Open Language Models JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 12

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T10:49:46.876444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-26T08:23:20.122338Z digest=sha256:ac70079d32769098d1c6e908a1b6e344c219fe7b55d049ede2d3df0f64023534

Observation 31453625-cfef-4665-abb4-a595ae2d112f · inbound

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability cites this paper.

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-07-04T17:20:00.203412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-25T23:49:17.752279Z digest=sha256:df5a11da5162adfbeab75fab2b7e41b3d166b496d159fc73e95bbfe15469e00c

Observation 1dbe164c-dcb3-4dc0-a19b-d6b2b08ee59b · inbound

Speculative Decoding at Temperature Zero: A Scoped Safety-Invariance Screen with a 48,072-Sample Expansion cites this paper.

Speculative Decoding at Temperature Zero: A Scoped Safety-Invariance Screen with a 48,072-Sample Expansion JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 6

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T16:59:58.329124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-26T00:05:06.647295Z digest=sha256:d54b73c0c6ca2c89a69e49741c5ec95443d6737463bd1ad8c2dbd63688b7d48f

Observation eefec10a-7cff-4449-8acb-d748a88d039a · inbound

What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics cites this paper.

What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-04T17:40:01.027199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-25T23:28:39.739645Z digest=sha256:ab4042eab92006a881f688492a137a91e2f2da96acc76661cebf9958c030d5c0

Observation 956da625-3d1b-46f8-9889-c106bc14a44a · inbound

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation cites this paper.

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 73

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T19:50:11.036006Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-25T20:58:53.119386Z digest=sha256:5ae8e606b0ddac9c6b80dd66566f98c6bb61e8d6650e8a8dccf8889a56b212fc

Observation de45d835-dd4d-4ddf-b57b-0a372331892f · inbound

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation cites this paper.

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-02T10:16:44.151383Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T10:16:44.151383Z digest=sha256:866e960c6c525745f8acc5683ea3cf00322341c1139288e47a9642e51df30f0a

Observation 8859bbc8-cb8e-45f9-8901-ba12c9ba546c · inbound

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation cites this paper.

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 12

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T20:00:07.954777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-25T20:55:44.549142Z digest=sha256:9f0d58a9c921c50e400dd5730cc8df9b1193c54e1a1e8a9d24a47a4bd513f323

Observation c297ccef-4712-429e-af2c-4a61e2323bfa · inbound

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models cites this paper.

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-06-26T04:38:59.217822Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-26T04:35:51.583460Z digest=sha256:f80d5bed530ceed183b085b04ca2592ef182244897d639c7060cebf1d7bad02e

Observation e3cdde68-2d24-4748-bf6c-afa1be02e180 · inbound

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models cites this paper.

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 74

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T17:35:51.343340Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-29T03:35:34.594617Z digest=sha256:015223217a1d643da5e1004e4b2e7a0b36ac32c86d8a887359cb4778afc933ea

Observation 4c1cb776-4ad5-4eea-8540-b9b8a9aff192 · inbound

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models cites this paper.

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 26

Resolution
metadata mismatch
local_arxiv, observed 2026-06-30T09:34:34.456037Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-30T09:32:59.824110Z digest=sha256:57c1cb3c044c30ff48ae2bfa3d7533be1207cc3d39da5e484b505ff9e9672eb9

Observation 93086946-f4f6-4ea4-a56d-ff4cfe48017b · inbound

SCARCE: Scalable Cascade Analysis for Rare-event Characterisation via Embeddings cites this paper.

SCARCE: Scalable Cascade Analysis for Rare-event Characterisation via Embeddings JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 10

Resolution
metadata mismatch
local_arxiv, observed 2026-06-30T07:04:20.785937Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-30T07:03:36.414202Z digest=sha256:9c3d9a2328b7cfc7e0a0ee05dba203ca515252eb06ef41f997feb394c2797a82

Observation 37b44ee2-1e89-4772-acbe-f46a9fbab962 · inbound

Safety Targeted Embedding Exploit via Refinement cites this paper.

Safety Targeted Embedding Exploit via Refinement JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 4

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T13:28:18.218798Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-07-03T13:23:31.038332Z digest=sha256:86360a2727744e31ef4f236aabbb189c4a06e453ebdfe33ec904dd6b7b40517d

Observation a28375f0-62c5-4792-bed7-befb999eca03 · inbound

Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety cites this paper.

Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-14T14:13:53.489886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-14T14:13:53.489886Z digest=sha256:fd1ee0cb8f5f844d253ae777a2255f0b2a327d9557a1e62c01b4a57ab4d43cb7

Observation 30d638b7-d589-47c4-8a9a-59d739ce9aec · inbound

The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators cites this paper.

The Entanglement Wall: Activation-Space Probes as Risk Detectors, Not Context Adjudicators JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-02T07:09:30.130477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T07:09:30.130477Z digest=sha256:31642dfd2eca1fd575cca3bf8cea8f2cc6ad00ea6bdc1eed9e93936f4d5f2fbe

Observation b430ccb1-6a13-4671-825e-1544dd768caa · inbound

How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions cites this paper.

How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-01T18:54:56.575779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T18:54:56.575779Z digest=sha256:a6109b65b6ba025f5a6556e10d6e448caf5d4c2ab6c581ffd98a998c23103860

Observation 01c18020-6f22-44a6-b176-6967213a4c85 · inbound

Defense Against LLM Backdoors using Critical Neuron Isolation Pruning cites this paper.

Defense Against LLM Backdoors using Critical Neuron Isolation Pruning JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-01T11:29:54.038302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T11:29:54.038302Z digest=sha256:b3878637798ae54896a442f48b2b96635639aba6e73381a80281cd76772334bf

Observation a01821a1-0262-4369-bc19-79bd1d0728e6 · inbound

Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation cites this paper.

Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T11:28:36.924563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T11:28:36.924563Z digest=sha256:d887834eae5accc8833800245eeecd23b35076b918c578cfa4a780197baaf1d5

Observation c08ec257-4107-4c63-bc5b-6e3e968135b9 · inbound

ContainmentBench: Trace-Based Evaluation of Post-Injection Containment in Tool-Using LLM Agents cites this paper.

ContainmentBench: Trace-Based Evaluation of Post-Injection Containment in Tool-Using LLM Agents JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-31T23:24:19.507389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T23:24:19.507389Z digest=sha256:30501ab7b282a5f39e37ec39cb6111371775e6c5af8027f7b86f07ddf124bfd5