Pith. sign in

Paper Citation Record · LEDGER

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

As of 12 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 7 inbound Pith citation observations for arXiv:2605.01687.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.01687 v1

Coverage vector

measured 77 of 77 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-10T16:00:32.413225Z

measured 84 of 84 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 7 of 7 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T00:32:05.121298Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-04T17:09:59.507308Z

Reference resolution

77 of 77 outbound references displayed

  • verified exact7
  • verified fuzzy44
  • unresolved1
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch25

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6fdd3147-9efa-4984-86a8-9b384510be0f · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.523408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:9249bb2deb9defb0aa9c609df034963d2c318436bc43d1f2dbd3593acf3d336c

Observation 676444c2-0a0b-4f5f-9d8d-2ca95f458ef9 · outbound

This paper cites 2025 , institution =.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , institution =

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.584202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:9377a733b1790a65a1b041ce026772be65d19f090caa50665111c303b6a7710c

Observation b3b87e30-6c09-446a-a728-ee5dc5783903 · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.556000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:2cfb3d617817bca36e4c3210180d810e7c453b3a9ae39913e30433881b4aab95

Observation 93ac462f-cbda-41d9-8f5b-c8f90a108bcf · outbound

This paper cites 34th USENIX Security Symposium (USENIX Security 25) , pages=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 34th USENIX Security Symposium (USENIX Security 25) , pages=

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.472746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:2820f01f75b2c24fda706304cefd37521900a73d08c9f197fad53e9a877262b2

Observation 564491a8-4c05-4997-9103-3bee6e9e20a3 · outbound

This paper cites LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet

Reference 5

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.117969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:6f1b9c8eacfbf93a8fe845b8bdca8175c0a207e64e9c461ddaf78fa7d884f889

Observation 2802c7a5-7496-43c9-8516-3cc02f1f917a · outbound

This paper cites RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking

Reference 6

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.171116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:7404fa175b010e644eea5716a1715111ac1ffaef7db474441b75f1810b1127d2

Observation a88475d0-e077-4036-9211-16f51b5852f3 · outbound

This paper cites SafeDialBench: A Fine-Grained Safety Benchmark for Large Language Models in Multi-Turn Dialogues.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety SafeDialBench: A Fine-Grained Safety Benchmark for Large Language Models in Multi-Turn Dialogues

Reference 7

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.061328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:add549761c37e4aaa3baffcce1e13c85a702ac924978e18d6b2efedfddf18b54

Observation ccc0fa3b-dfe9-4e8b-b4b9-e7df34205fd6 · outbound

This paper cites Safety Alignment Should Be Made More Than Just a Few Tokens Deep.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Safety Alignment Should Be Made More Than Just a Few Tokens Deep

Reference 8

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:00.975345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:2ba82425b927486c3536e8d4a24ba29a3665766bb140299589e5a4693406a00f

Observation 0fc7078f-aac2-4fd6-a0f5-f2d1a84b7cb4 · outbound

This paper cites Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:31:01.194142Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:390db6bd97e6dffd7e91d9a4c6f634aa417b867cdffff04a62f065a8b47b6104

Observation 594b6990-04dc-4f50-a459-fa24738536e2 · outbound

This paper cites CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:31:01.152129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:97194b8af90f81ed5223c01f02956ea1a5abe531e50e24ab825e4d68693d2ddc

Observation 6d6b49f1-708a-4c48-8980-89990592fc73 · outbound

This paper cites 2025 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML) , pages=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML) , pages=

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.479664Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:97a9ae06e0dc237830db0bcccf7b8d9fc0afd9c231e2e5e5eb4a03a7d66297d1

Observation 159f575c-bfda-4c4a-9682-b2616b6b7fd1 · outbound

This paper cites 2023 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2023 , eprint=

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.568138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:715085935cf92455e8f06b4c2db11c1fd5ad9f29e14440b5142d090fb8688cfb

Observation 0d7deb2d-7458-48cc-b837-dabc224129f4 · outbound

This paper cites Advances in Neural Information Processing Systems , volume=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Advances in Neural Information Processing Systems , volume=

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.527230Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:01f8582cb68b36ed07e75f76e4bd8c6b71e53c57a3bd826429bcc51ef5f0740b

Observation ec801bc7-02f6-4cd4-b697-fc8ec09f7a77 · outbound

This paper cites Advances in Neural Information Processing Systems , volume=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Advances in Neural Information Processing Systems , volume=

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.588249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:c29e50299de61ad5269c63d8d0f8f19c0c436afe8667dba43efc7b7b9fd3e5e1

Observation 7ed6d5f1-d36b-4169-a314-f39385239b51 · outbound

This paper cites HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Reference 15

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T09:31:01.259730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:5dffd70a065d698b8fdf90cb3ef858b4a5038f22f70ddc12e26556411c68a9da

Observation 2757514c-1a43-4899-8217-206f5c486cfe · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 16

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T09:31:01.090545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:0393365c49d9256a0cea26bc27053dd24b15cab1e7154a39f0b5b212918139ab

Observation 6a9c689d-4263-40dd-a3d4-7dd306a4c755 · outbound

This paper cites SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:31:00.988350Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:1907c4d805a771f91c35f15ddc73be3466e48ab6198d3d14c4be040d503f6e73

Observation 8e386a28-aaa2-4d51-9187-1f729c03705b · outbound

This paper cites Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.284910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:e57f8651325f06f102a8c31e0864dc26c762580f8b4a827aad702dd5c30d3f8f

Observation 3b2fab11-c5ea-4daf-85e9-6c5c0e388825 · outbound

This paper cites JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.031176Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:aef547b655273f2f6eed649769f1fa74a3daf2810ff50bb8c2074b26ae0344dd

Observation 67893cbf-c80c-41c7-b2d2-f3776cc73794 · outbound

This paper cites Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs

Reference 20

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.138639Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:4cc888f611c7db81fbd576049c61ea6c91e1a5dae1ecd93edc9ae516a1df6ab9

Observation 5cc4aa8d-625b-4899-89a0-bb40273b0134 · outbound

This paper cites Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!

Reference 21

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T08:58:35.940011Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:ef29c55e4a91e250b6fecafa95518d71844fa73050134d5cd3e6c3dec9c44e98

Observation a302b4f9-a0ef-419f-af3f-5b3279fb3f1e · outbound

This paper cites Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation

Reference 22

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T22:00:51.596826Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:b0e26339db09e56962ba5a5008ba1b54fe5802effd4dd35de18fd2f1c1c9bd98

Observation 8bbcf1f9-cc39-4b84-866b-3b1ee981fff3 · outbound

This paper cites Latent Jailbreak: A Benchmark for Evaluating Text Safety and Output Robustness of Large Language Models.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Latent Jailbreak: A Benchmark for Evaluating Text Safety and Output Robustness of Large Language Models

Reference 23

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.017286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:dfd1d40d86966f518d92480dae6fff99dcc5e0b057639e8cf4414210cf8ea6be

Observation 4f3c832a-db8e-4de2-8d4b-61621425defc · outbound

This paper cites 2024 , eprint =.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , eprint =

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.509657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:929c3174f159cab5b90f0b7d7228082ce8ca39d72a794eba29ec96b178c0d887

Observation dd350fd1-a586-4b59-b169-dcc003e615ff · outbound

This paper cites Computer , volume=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Computer , volume=

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.562450Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:ddaa5bde7d5ba124f04643f5107ad8aaa657898a57e046f56a115d2628ebcbd1

Observation 83f0276c-0ad2-4226-a085-e9664158827c · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.616996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:e0e8ffdc003202e372ec04bb480fdb526885bf35e48b7029991cb4a1ec3434c3

Observation e381182a-4d43-467b-8942-e565a580950e · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.591576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:db5b9dfb8116ec796aeac86b3ecd6aaa27f59784ce014303b9fbc5fc71f03b31

Observation 2b16e8d8-2266-476f-80e7-353915615796 · outbound

This paper cites 2025 , month = apr, day =.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , month = apr, day =

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.553241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:4a7c8255a2068ac848575895fd603a53b22c43f7875fae00a60c1646e7a75e8f

Observation 5aaa337b-cf50-42b5-ae66-09c6cf565524 · outbound

This paper cites Best-of-N Jailbreaking.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Best-of-N Jailbreaking

Reference 29

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.204907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:482faa1db003e1a98632b7ae137b220069f983c1624dd0cc3a9fa4fd9c4e534a

Observation e459db5c-d7c9-402f-b794-eb4824565c12 · outbound

This paper cites 2025 , month = feb, day =.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , month = feb, day =

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.512822Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:b9b5f506bd561e3c35650ad56ebf36822468ca338aca951780b42cef98045655

Observation 16b7f8c6-a63b-4aaa-84e3-3a9c9df98daa · outbound

This paper cites Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models

Reference 31

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T09:31:01.210573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:3b541778193f0ba1950410fedc011cf49e73243256ab8f7b8ce1d544561f96d7

Observation 75b0a355-faa2-430b-b9f8-462641cb5333 · outbound

This paper cites author=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety author=

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.559341Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:0c417e1468e06af4630e8078de16e29320114f85040e991d6e3184551a63e6ae

Observation 095f2c12-a894-4ffa-94d0-3f81ba387840 · outbound

This paper cites 2024 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , eprint=

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.609051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:9376740a3ef3c297dad1b6faae1594595eb07727ca1d3668faab4a058dc4469a

Observation 58db8de2-4657-4f0c-b486-b091a2229339 · outbound

This paper cites From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models

Reference 34

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:00.953629Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:b612e6e0cd80f818e3e148311e82b45caf4bfde486db308d173c40e3064a2b03

Observation e467c562-5fe0-4b1d-827d-bd917a361b38 · outbound

This paper cites 2024 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , eprint=

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.597853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:8dbb888f27e3e3a02da7c2d479d7fdd28f1a0f7d4b35576d214274e472ab5135

Observation 9b175977-93f9-46c1-aecf-86bc36f4500f · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 36

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T09:31:01.181661Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:78b6d4550e4ce85ed5375e1b7c59293398239b51e42e87950f8dcfaee97c23fd

Observation cf6f2377-d72e-441c-a573-7eeb4dc16afa · outbound

This paper cites GPT-4o System Card.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety GPT-4o System Card

Reference 37

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T09:31:01.291137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:290c49cbe9e21d5da32275d02f18330c272570f69f16136b1c6341e36101f0d5

Observation 81b4e7d8-23c5-4eb3-a577-99832bf8482a · outbound

This paper cites MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue

Reference 38

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.003678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:ea0a85e158bf397fd9bc1cc475f4bdc4e58bacd4244e55b24833bb7e007db923

Observation 37728d1d-6f66-4029-9283-10849ec654a8 · outbound

This paper cites Advances in Neural Information Processing Systems , volume=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Advances in Neural Information Processing Systems , volume=

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.577233Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:f452146b607889b12e8ab4cffae20d78db5577ff52c9e4b9889de8f5a2da7cff

Observation bdf4ee67-6c63-4b44-a0e6-ce72407fe6bb · outbound

This paper cites 2025 , howpublished =.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , howpublished =

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.547881Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:6374051c25d516d265335829ff354ed033b7d8be81cca06e45e5758811c98eb9

Observation 381e3394-bafc-422c-ab49-97921b793512 · outbound

This paper cites 2024 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , eprint=

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.581206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:2c7f6d0ed24c4f5e705adb2e31f8df88ddacd18b3d250a5baff4cdeede30c35d

Observation 7210aaf0-1365-44fa-b328-d94281f84e69 · outbound

This paper cites SoSBench: Benchmarking Safety Alignment on Six Scientific Domains.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

Reference 42

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T09:31:01.236234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:558a790ff1d3ba7b37b71a72a02d8fbdd93a03223e67d15d51bc7405a3197ba4

Observation 4279a036-820a-4619-8e3f-e68edefdcb15 · outbound

This paper cites SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities

Reference 43

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.221364Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:8d25ae7598e1ef4ec9c3533cfe068af14d190e5281be9098b78657a91f5d10b0

Observation 8d8d3568-fe6a-4bdb-a3be-123e29301775 · outbound

This paper cites IEEE Transactions on Neural Networks and Learning Systems , volume=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety IEEE Transactions on Neural Networks and Learning Systems , volume=

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.485941Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:6ef2f130dd14a106092e01f04421233299f3cd2439fe59c0d0201b8845e51e3b

Observation d173da48-cc9b-478c-beb5-18c13f963ae6 · outbound

This paper cites On Statistical Bias In Active Learning: How and When To Fix It.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety On Statistical Bias In Active Learning: How and When To Fix It

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:31:01.009039Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:422b425d0a7bc2c7eebf72e9c6888b03b619de5a46293390c900d3d366eca3ae

Observation b809b336-e4db-44ff-922c-99944a7e300d · outbound

This paper cites Self-Taught Evaluators.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Self-Taught Evaluators

Reference 46

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.129656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:4c9965148b370c4aa1ba307f97ce066dadf46459b2c3390f8fae327d354ac21e

Observation 5e7bdbf8-685c-4fc0-8c81-62c31d660c87 · outbound

This paper cites 2024 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , eprint=

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.482653Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:155b5e881b2ebf5e4a19ee47acdf3672b873547de5da1bc7213b1d1af56cebfa

Observation 37bdac1c-5d68-433f-b4cc-e622b3ea3d5a · outbound

This paper cites 2024 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , eprint=

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.516652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:4c122390809d56dbcf85887137bd836c979263974a1d3f1bae4150a495c8cd51

Observation 2c98548d-9303-4178-8206-d60e67cb8f48 · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.542339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:5e2d05608858f1edaa1482a5da766c84c8e484550fce0320d6082b2f49d96ef2

Observation ac8858e5-a760-4fc8-94b8-9168e07f01ec · outbound

This paper cites Standard Models , author=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Standard Models , author=

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.539508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:dd08dc6942661d5e0c71de6d857a73003f7a87b31364126c84dbc354b2b26401

Observation 0f7faae3-cd8f-4371-9f6b-0608d11dea79 · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.492226Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:bd305ff1395f497c786ffe96510fee32b00c0b1140169c139046d31004173e20

Observation 358e08b6-e893-47d9-9bb2-f82c6c91c74f · outbound

This paper cites 2023 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2023 , eprint=

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.489172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:b9de578a035b0bc442241cb127bafcdfdb755945e46c0f6462a78076c9210eed

Observation 2df1776f-2fd1-4471-819d-998a7098d14f · outbound

This paper cites 2024 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , eprint=

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.536562Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:9ea626f63b49e5f02734dbe7c3059611b7433ade07bb48670f89426a761d1db6

Observation 885bfa4b-ea8a-4a04-81a8-751462a3e0fc · outbound

This paper cites Continuous Judgment Tasks , author=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Continuous Judgment Tasks , author=

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.602041Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:b2dd962b2ffe847f6aa69212bce65afe06899022085d913c6c3deefcda3218cc

Observation 858fa60d-121f-4e21-b07b-976acde966e2 · outbound

This paper cites 2024 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , eprint=

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.545173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:4a87ee81666f80946384c699ebfd21019a1c178d56586e88a9a75fad54979827

Observation 7ac2853b-77b7-4c43-b562-1fdf5c0d71a5 · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.530100Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:19aaabcd7ce05f108ce68bc1d37f10ea0da6f800381681bbece1770a7a53029e

Observation 335ec422-e60e-4221-b583-cddfc5eae1c8 · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.498805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:c3feae6b4aa78bb12a25a2ac2a2bf4efc0046b23f883b81779c440c60090ea57

Observation 134c2e54-2d36-4e10-9bad-97879483cc8c · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.502712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:94a1774c7c089881d93f6fc7db2cf31d8fad61bea59f8692438af1300fff1498

Observation d472260b-92f9-4496-8d5b-13acd40cad6c · outbound

This paper cites 2025 , url =.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , url =

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.533135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:fff1674daa7a8f7b2f14c6430517996ba5fd4352eae0271578bd33420f029e9a

Observation 8d8e083d-a766-49e0-bd6b-d980fc77c9da · outbound

This paper cites 2024 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , eprint=

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.613001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:408be325e5e3933187f40e89ac39777c37ba0d2050673e3570d499bb54364b1b

Observation 346158e7-c21e-4343-92e1-3b5246e5ebc9 · outbound

This paper cites 2024 , url =.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2024 , url =

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.550605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:9805b1754ee2ebaa7cbd9bb8dc45db089cdab0ccf0ad5098958386507af2ce69

Observation fcc5ba13-c697-44ff-adba-f3fc6cf884e4 · outbound

This paper cites 2023 , howpublished =.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2023 , howpublished =

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.565358Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:201a45ad83a1d566911dd76b7bc9941df0df7c2e51751de7052f3559fdca71fd

Observation 2f294101-b005-4cdd-b3ea-149c0c3dc72d · outbound

This paper cites 2025 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2025 , eprint=

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.574362Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:13199e08b6d6f2c4c757636884600927165407a7d76c1b20abde2e595ff494d4

Observation 14468d95-2a9d-4946-8b71-0bd01fc3ecb4 · outbound

This paper cites 2023 , eprint=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2023 , eprint=

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.620546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:a2c0aa5249795930d409f7720877f05cbca96056ab5a73a0063f3f03800afcff

Observation b23637f1-ef7d-4a3c-a06f-cfd6d7aa7bcc · outbound

This paper cites Advances in neural information processing systems , volume=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Advances in neural information processing systems , volume=

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.571482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:9817efd2d60bbd8a788ea1feb686966755c7076b3322493f06d8a6620b334e29

Observation 06be3a5d-de18-4a8c-abfd-6c8757d6969e · outbound

This paper cites Educ Psychol Meas , volume=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Educ Psychol Meas , volume=

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.605630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:720820f1c962d4e9c13f5219251314503ffdc82f2ccd0ebd96a4aa70c45b491d

Observation 8eadd351-68b8-4279-bc13-23c1a31946e5 · outbound

This paper cites & Shao, J.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety & Shao, J

Reference 67

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.052993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:ca484db4446eaa47f39c5b73f3a0e136dc2138c28ed2eaa435ae9fdadd4d4daa

Observation 30079e97-6687-405e-b831-e22a2b7b2820 · outbound

This paper cites Steering dialogue dynamics for robust- ness against multi-turn jailbreaking attacks.arXiv preprint arXiv:2503.00187.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Steering dialogue dynamics for robust- ness against multi-turn jailbreaking attacks.arXiv preprint arXiv:2503.00187

Reference 68

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:31:01.073795Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:56ea9a22c3e1afaa8172e8817f357cd34c752e6012c77874bdf5f16ea584200e

Observation 2bf7f2eb-20c9-4b4a-8778-8363e4058464 · outbound

This paper cites X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents

Reference 69

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:01.098291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:af169f0580efc4dd1a406075dd94f2a27345321ccaf8acce75369c3f85132154

Observation d5ab5270-0b75-4bc3-8b4a-e7016fd8327e · outbound

This paper cites 2026 , publisher=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2026 , publisher=

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.594614Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:cf6c943c39ba50e2fabf8de6f73e555fd310ab6b457ab9015e337087a1593caf

Observation dff50217-3abb-4fc2-b9dc-b41f6d626a53 · outbound

This paper cites an unresolved cited work.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Unresolved cited work

Reference 71

Resolution
unresolved
raw_fallback, observed 2026-05-17T17:25:00.519929Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:5fdcc7e1238db3b7906a06dabf1371ed8a77a3e98d6e4f5f6a5e333a34840cdb

Observation e7c8572c-03e7-4f97-8a32-de928a2428ea · outbound

This paper cites 2019 IEEE symposium on security and privacy (SP) , pages=.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2019 IEEE symposium on security and privacy (SP) , pages=

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.476028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:9d32ddfa0cc5dbba0e2f1638d2012c81bfb2b9bb60b340d5110b38f3473edade

Observation 8f69c2c3-9436-4e3c-8481-401af6484992 · outbound

This paper cites A Repository of Conversational Datasets.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety A Repository of Conversational Datasets

Reference 73

Resolution
verified exact
arxiv_id, observed 2026-07-04T23:40:06.189886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:a1ac52717793f4e2e5a8f57e6d44ffd8b82cbc2cba9718c1f2149b4a36957470

Observation 91f98b2d-f620-4f93-98d4-8a539eddfc09 · outbound

This paper cites gpt-oss-120b & gpt-oss-20b Model Card.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety gpt-oss-120b & gpt-oss-20b Model Card

Reference 74

Resolution
metadata mismatch
local_arxiv, observed 2026-05-11T09:31:01.107243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:abf5c49a3e6cd5016585dfc317133050ae0cdc45d5b74402b80ca5e37ac9343c

Observation 741ebe01-1101-4823-9dcf-8eb789514f8f · outbound

This paper cites Qwen3Guard Technical Report.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Qwen3Guard Technical Report

Reference 75

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T22:33:37.835217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:c8b826c437718a8885919760081f916a89af2a391100bc889ea53287ac0d74ca

Observation 42caccb8-ce6d-4cb4-8c1b-9219d9579b58 · outbound

This paper cites Sema: Simple yet effective learning for multi-turn jailbreak attacks.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety Sema: Simple yet effective learning for multi-turn jailbreak attacks

Reference 76

Resolution
verified exact
arxiv_id, observed 2026-05-11T09:31:01.043904Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:b4a41f8bf6c352cf8677aa3625df24fca5951dd459ddfadf32ba66b98aaa97f2

Observation 280d419c-2947-4a17-a985-2c2a8e3ae704 · outbound

This paper cites 2026 , eprint =.

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety 2026 , eprint =

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T17:25:00.505825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T16:00:32.413225Z digest=sha256:ffa2d0ca259c98fa1f50a00565587a2de2cd971650172356f0bfe90d68cad048

Pith citing papers

Observation f2a19d41-325d-4348-a32c-b929caee1f59 · inbound

Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models cites this paper.

Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-06-29T17:53:47.689060Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-29T17:43:47.849960Z digest=sha256:9967302cba421a7893b4a0334c412c43e389c327dcfb917e0ed38400eaf1ebc4

Observation de24e602-c619-4b58-a1f9-261f2b923446 · inbound

NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms cites this paper.

NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-07-04T04:09:34.509121Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-26T17:13:26.201462Z digest=sha256:e0fec4d6b9da9c109b2eb9954f250548f3c79857040d3e9a453395933184893d

Observation 68e46dcc-a896-4433-b543-912a1afd7275 · inbound

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models cites this paper.

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-07-04T17:09:59.508529Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-25T23:52:02.327522Z digest=sha256:42de049b59e258b7fa83778fa10b36f06cc70e23bc10e85d800429de957ffc8a

Observation e3ad3acc-b288-4b6b-97c0-81ab76f9625d · inbound

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures cites this paper.

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-06-30T06:24:18.533375Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-07-11T11:50:26.030339Z digest=sha256:adc7a040ce2f73be4d194be4fe67f6cf1132ced13b29242008148c1cdda664fc

Observation f2ad8565-af09-4cf7-ad3e-6b31b461f799 · inbound

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures cites this paper.

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

Reference 9471

Resolution
unresolved
no resolver link, observed 2026-08-02T09:38:57.860575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T09:38:57.860575Z digest=sha256:24e9b17d9e00d72f7c11676209c4e9416ee83ee6b832b67738e74eacd05aba9d

Observation b558507a-d528-437b-935f-a181025123af · inbound

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures cites this paper.

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

Reference 9471

Resolution
unresolved
no resolver link, observed 2026-08-03T02:07:27.996765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T02:07:27.996765Z digest=sha256:4708b9c64711d57546066276779b5cbe674ffe30463ba9aeb21a66d22ad1cabc

Observation 873285c7-9390-4192-b59f-e258f18a6098 · inbound

SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks cites this paper.

SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-06T00:32:05.121298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T00:32:05.121298Z digest=sha256:db637f3aacb3701ba5b19b46a837dd2412f32e684df3e1e60229e2d9c40ebc06