{"as_of":"2026-08-13T00:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb4f166f10deed46519fba2715edf0171a21ca627a378b3dc1ce785c9da9449c","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:00:32.413225Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:32:05.121298Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T17:09:59.507308Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"cited_work":{"arxiv_id":"2605.01687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.01687","snapshot_observed_at":"2026-07-04T17:09:59.507308Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","venue":"cs.CL","work_id":"97439a06-e61b-4cba-b519-f72ac8f8aae1","year":2026},"citing_paper":{"arxiv_id":"2605.26409","last_updated":"2026-05-26T00:36:42Z","snapshot_observed_at":"2026-08-02T10:55:21.817292Z","submitted_at":"2026-05-26T00:36:42Z","title":"Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T17:43:47.849960Z"},"links":{"cited_paper":"/paper/2605.01687","citing_paper":"/paper/2605.26409"},"observation_digest":"sha256:9967302cba421a7893b4a0334c412c43e389c327dcfb917e0ed38400eaf1ebc4","observation_id":"f2a19d41-325d-4348-a32c-b929caee1f59","resolution":{"observed_at":"2026-06-29T17:53:47.689060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"cited_work":{"arxiv_id":"2605.01687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.01687","snapshot_observed_at":"2026-07-04T17:09:59.507308Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","venue":"cs.CL","work_id":"97439a06-e61b-4cba-b519-f72ac8f8aae1","year":2026},"citing_paper":{"arxiv_id":"2606.20408","last_updated":"2026-06-19T01:38:27Z","snapshot_observed_at":"2026-08-12T14:23:52.851966Z","submitted_at":"2026-06-18T15:57:53Z","title":"NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T17:13:26.201462Z"},"links":{"cited_paper":"/paper/2605.01687","citing_paper":"/paper/2606.20408"},"observation_digest":"sha256:e0fec4d6b9da9c109b2eb9954f250548f3c79857040d3e9a453395933184893d","observation_id":"de24e602-c619-4b58-a1f9-261f2b923446","resolution":{"observed_at":"2026-07-04T04:09:34.509121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"cited_work":{"arxiv_id":"2605.01687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.01687","snapshot_observed_at":"2026-07-04T17:09:59.507308Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","venue":"cs.CL","work_id":"97439a06-e61b-4cba-b519-f72ac8f8aae1","year":2026},"citing_paper":{"arxiv_id":"2606.24388","last_updated":"2026-06-23T10:20:40Z","snapshot_observed_at":"2026-07-06T23:58:58.854077Z","submitted_at":"2026-06-23T10:20:40Z","title":"PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:02.327522Z"},"links":{"cited_paper":"/paper/2605.01687","citing_paper":"/paper/2606.24388"},"observation_digest":"sha256:42de049b59e258b7fa83778fa10b36f06cc70e23bc10e85d800429de957ffc8a","observation_id":"68e46dcc-a896-4433-b543-912a1afd7275","resolution":{"observed_at":"2026-07-04T17:09:59.508529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"cited_work":{"arxiv_id":"2605.01687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.01687","snapshot_observed_at":"2026-07-04T17:09:59.507308Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","venue":"cs.CL","work_id":"97439a06-e61b-4cba-b519-f72ac8f8aae1","year":2026},"citing_paper":{"arxiv_id":"2606.30219","last_updated":"2026-07-31T12:14:44Z","snapshot_observed_at":"2026-08-05T23:10:57.386057Z","submitted_at":"2026-06-29T12:33:06Z","title":"EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2605.01687","citing_paper":"/paper/2606.30219"},"observation_digest":"sha256:adc7a040ce2f73be4d194be4fe67f6cf1132ced13b29242008148c1cdda664fc","observation_id":"e3ad3acc-b288-4b6b-97c0-81ab76f9625d","resolution":{"observed_at":"2026-06-30T06:24:18.533375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01687","snapshot_observed_at":"2026-08-02T09:38:57.860575Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30219","last_updated":"2026-07-31T12:14:44Z","snapshot_observed_at":"2026-08-05T23:10:57.386057Z","submitted_at":"2026-06-29T12:33:06Z","title":"EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures","version":4},"reference_index":9471,"source":"pdf_text","source_observed_at":"2026-08-02T09:38:57.860575Z"},"links":{"cited_paper":"/paper/2605.01687","citing_paper":"/paper/2606.30219"},"observation_digest":"sha256:24e9b17d9e00d72f7c11676209c4e9416ee83ee6b832b67738e74eacd05aba9d","observation_id":"f2ad8565-af09-4cf7-ad3e-6b31b461f799","resolution":{"observed_at":"2026-08-02T09:38:57.860575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01687","snapshot_observed_at":"2026-08-03T02:07:27.996765Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30219","last_updated":"2026-07-31T12:14:44Z","snapshot_observed_at":"2026-08-05T23:10:57.386057Z","submitted_at":"2026-06-29T12:33:06Z","title":"EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures","version":5},"reference_index":9471,"source":"pdf_text","source_observed_at":"2026-08-03T02:07:27.996765Z"},"links":{"cited_paper":"/paper/2605.01687","citing_paper":"/paper/2606.30219"},"observation_digest":"sha256:4708b9c64711d57546066276779b5cbe674ffe30463ba9aeb21a66d22ad1cabc","observation_id":"b558507a-d528-437b-935f-a181025123af","resolution":{"observed_at":"2026-08-03T02:07:27.996765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01687","snapshot_observed_at":"2026-08-06T00:32:05.121298Z","title":"Multibreak: A scalable and diverse multi-turn jailbreak benchmark for evaluating llm safety,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01117","last_updated":"2026-08-02T09:24:08Z","snapshot_observed_at":"2026-08-06T23:25:36.295333Z","submitted_at":"2026-08-02T09:24:08Z","title":"SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T00:32:05.121298Z"},"links":{"cited_paper":"/paper/2605.01687","citing_paper":"/paper/2608.01117"},"observation_digest":"sha256:db637f3aacb3701ba5b19b46a837dd2412f32e684df3e1e60229e2d9c40ebc06","observation_id":"873285c7-9390-4192-b59f-e258f18a6098","resolution":{"observed_at":"2026-08-06T00:32:05.121298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.01687/citation-record","integrity":"/paper/2605.01687/integrity","json":"/paper/2605.01687/citation-record.json","paper":"/paper/2605.01687"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.775981Z","title":"2025 , eprint=","venue":null,"work_id":"26c7b6ed-f86e-4ed8-b9ed-b1783d90255b","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:9249bb2deb9defb0aa9c609df034963d2c318436bc43d1f2dbd3593acf3d336c","observation_id":"6fdd3147-9efa-4984-86a8-9b384510be0f","resolution":{"observed_at":"2026-05-17T17:25:00.523408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , institution =","venue":null,"work_id":"556bef82-6894-49bc-ab61-e7f096f9e991","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:9377a733b1790a65a1b041ce026772be65d19f090caa50665111c303b6a7710c","observation_id":"676444c2-0a0b-4f5f-9d8d-2ca95f458ef9","resolution":{"observed_at":"2026-05-17T17:25:00.584202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"0301816e-0f97-4832-a28a-77176657c37c","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:2cfb3d617817bca36e4c3210180d810e7c453b3a9ae39913e30433881b4aab95","observation_id":"b3b87e30-6c09-446a-a728-ee5dc5783903","resolution":{"observed_at":"2026-05-17T17:25:00.556000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"34th USENIX Security Symposium (USENIX Security 25) , pages=","venue":null,"work_id":"c2f429f0-06ce-4992-9f46-e151ee497133","year":null},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:2820f01f75b2c24fda706304cefd37521900a73d08c9f197fad53e9a877262b2","observation_id":"93ac462f-cbda-41d9-8f5b-c8f90a108bcf","resolution":{"observed_at":"2026-05-17T17:25:00.472746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15221","last_updated":"2024-09-04T00:58:59Z","snapshot_observed_at":"2026-08-12T22:56:25.482748Z","submitted_at":"2024-08-27T17:33:30Z","title":"LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet","version":2},"cited_work":{"arxiv_id":"2408.15221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15221","snapshot_observed_at":"2026-07-04T17:30:00.600665Z","title":"Llm defenses are not robust to multi-turn human jailbreaks yet","venue":null,"work_id":"9c0488b9-9f5f-4f7a-ba2b-55e43143aae7","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2408.15221","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:bc5948e33218b76e1cb8e74119f34301a332b2386e20c743154feefaad4f70bc","observation_id":"564491a8-4c05-4997-9103-3bee6e9e20a3","resolution":{"observed_at":"2026-05-11T09:31:01.117969Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17458","last_updated":"2025-06-07T08:11:07Z","snapshot_observed_at":"2026-08-12T22:37:19.205060Z","submitted_at":"2024-09-26T01:24:17Z","title":"RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking","version":2},"cited_work":{"arxiv_id":"2409.17458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.17458","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Red queen: Safe- guarding large language models against concealed multi-turn jailbreaking","venue":null,"work_id":"9e127d71-64ca-4513-8a3e-ea6546640d48","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2409.17458","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:28bdff9f180121d8208b7db5c594ff003d31c0bba3573eaa74e67b2b315b6b23","observation_id":"2802c7a5-7496-43c9-8516-3cc02f1f917a","resolution":{"observed_at":"2026-05-11T09:31:01.171116Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.11090","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:47:27.601323Z","title":"SafeDialBench: A Fine-Grained Safety Benchmark for Large Language Models in Multi-Turn Dialogues","venue":null,"work_id":"afbdcae3-4dc5-4018-93e2-084ab1c204f6","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:add549761c37e4aaa3baffcce1e13c85a702ac924978e18d6b2efedfddf18b54","observation_id":"a88475d0-e077-4036-9211-16f51b5852f3","resolution":{"observed_at":"2026-05-11T09:31:01.061328Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-12T23:46:49.092229Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":"2406.05946","doi":"10.48550/arxiv.2406.05946","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Safety alignment should be made more than just a few tokens deep","venue":"arXiv (Cornell University)","work_id":"40539ea6-b6ba-4195-971b-53c52efa9597","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:cce5ec6c2a0120cd64c6ea1c25b67224daae23062ebc3034526716da5c85686a","observation_id":"ccc0fa3b-dfe9-4e8b-b4b9-e7df34205fd6","resolution":{"observed_at":"2026-05-11T09:31:00.975345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11459","last_updated":"2024-10-15T10:07:15Z","snapshot_observed_at":"2026-08-12T22:22:53.507362Z","submitted_at":"2024-10-15T10:07:15Z","title":"Jigsaw Puzzles: Splitting Harmful Questions to Jailbreak Large Language Models","version":1},"cited_work":{"arxiv_id":"2410.11459","doi":"10.48550/arxiv.2410.11459","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.11459","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2410.11459 , year=","venue":"arXiv (Cornell University)","work_id":"e44e7930-298b-49ba-ad8d-515babd9d878","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2410.11459","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:59519be915b63fb0eee0f09a068b9b0ee01f829094f25afbcd36c121e09e6caa","observation_id":"0fc7078f-aac2-4fd6-a0f5-f2d1a84b7cb4","resolution":{"observed_at":"2026-05-11T09:31:01.194142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17626","last_updated":"2024-06-25T15:13:02Z","snapshot_observed_at":"2026-08-12T23:35:11.986375Z","submitted_at":"2024-06-25T15:13:02Z","title":"CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference","version":1},"cited_work":{"arxiv_id":"2406.17626","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17626","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2406.17626 , year=","venue":null,"work_id":"5ce0716f-2a97-4702-9a19-a20672f2cdbf","year":null},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2406.17626","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:722fe30062f3f024764010bb679f64b9af5daae3688819028d45af46b99f23f6","observation_id":"594b6990-04dc-4f50-a459-fa24738536e2","resolution":{"observed_at":"2026-05-11T09:31:01.152129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML) , pages=","venue":null,"work_id":"ba7524ec-ad30-45f9-90cd-2a9dd6b78a80","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:97a9ae06e0dc237830db0bcccf7b8d9fc0afd9c231e2e5e5eb4a03a7d66297d1","observation_id":"6d6b49f1-708a-4c48-8980-89990592fc73","resolution":{"observed_at":"2026-05-17T17:25:00.479664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"061e9912-6e0b-41dc-8618-d1a99fe9babe","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:715085935cf92455e8f06b4c2db11c1fd5ad9f29e14440b5142d090fb8688cfb","observation_id":"159f575c-bfda-4c4a-9682-b2616b6b7fd1","resolution":{"observed_at":"2026-05-17T17:25:00.568138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"4570b7ab-1b0b-4721-ac6c-486a9d6f8828","year":null},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:01f8582cb68b36ed07e75f76e4bd8c6b71e53c57a3bd826429bcc51ef5f0740b","observation_id":"0d7deb2d-7458-48cc-b837-dabc224129f4","resolution":{"observed_at":"2026-05-17T17:25:00.527230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"a886337e-b674-42bd-980e-008aeea7c829","year":null},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:c29e50299de61ad5269c63d8d0f8f19c0c436afe8667dba43efc7b7b9fd3e5e1","observation_id":"ec801bc7-02f6-4cd4-b697-fc8ec09f7a77","resolution":{"observed_at":"2026-05-17T17:25:00.588249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":"2402.04249","doi":"10.48550/arxiv.2402.04249","metadata_source":"pith","pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","venue":"cs.LG","work_id":"b0b0303f-2444-4789-a979-8153624312ff","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:5dffd70a065d698b8fdf90cb3ef858b4a5038f22f70ddc12e26556411c68a9da","observation_id":"7ed6d5f1-d36b-4169-a314-f39385239b51","resolution":{"observed_at":"2026-05-11T09:31:01.259730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:0393365c49d9256a0cea26bc27053dd24b15cab1e7154a39f0b5b212918139ab","observation_id":"2757514c-1a43-4899-8217-206f5c486cfe","resolution":{"observed_at":"2026-05-11T09:31:01.090545Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-08-12T23:38:07.892461Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":"2406.14598","doi":"10.48550/arxiv.2406.14598","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2406.14598 (2025)","venue":"arXiv (Cornell University)","work_id":"5f6c39b5-65d4-4261-a0d0-63007ebce626","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:6463e5e387814fec3726a85f9cc58e007b1e9a9ee2d469776317e12efbfc3bd1","observation_id":"6a9c689d-4263-40dd-a3d4-7dd306a4c755","resolution":{"observed_at":"2026-05-11T09:31:00.988350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-12T05:31:18.633255Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":"2308.09662","doi":"10.48550/arxiv.2308.09662","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Poria, S","venue":"arXiv (Cornell University)","work_id":"829e5d9e-ef8c-4b87-84c4-1f759d22c9e4","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:e57f8651325f06f102a8c31e0864dc26c762580f8b4a827aad702dd5c30d3f8f","observation_id":"8e386a28-aaa2-4d51-9187-1f729c03705b","resolution":{"observed_at":"2026-05-11T09:31:01.284910Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03027","last_updated":"2024-11-24T06:22:37Z","snapshot_observed_at":"2026-08-06T14:20:00.145899Z","submitted_at":"2024-04-03T19:23:18Z","title":"JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks","version":4},"cited_work":{"arxiv_id":"2404.03027","doi":"10.48550/arxiv.2404.03027","metadata_source":"pith","pith_arxiv_id":"2404.03027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreakv-28k: A benchmark for assessing the robustness of multimodal large language models against jailbreak attacks","venue":"cs.CR","work_id":"70be9f1e-35df-4670-9f5f-fb5d97c1816f","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2404.03027","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:aef547b655273f2f6eed649769f1fa74a3daf2810ff50bb8c2074b26ae0344dd","observation_id":"3b2fab11-c5ea-4daf-85e9-6c5c0e388825","resolution":{"observed_at":"2026-05-11T09:31:01.031176Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13387","last_updated":"2023-09-04T01:47:30Z","snapshot_observed_at":"2026-08-12T11:13:18.554173Z","submitted_at":"2023-08-25T14:02:12Z","title":"Do-Not-Answer: A Dataset for Evaluating Safeguards in LLMs","version":2},"cited_work":{"arxiv_id":"2308.13387","doi":"10.48550/arxiv.2308.13387","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.13387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards veri- fying the geometric robustness of large-scale neural net- works","venue":"arXiv (Cornell University)","work_id":"7d461849-cc8d-4f7f-bf07-6c5e9ea94914","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2308.13387","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:4cc888f611c7db81fbd576049c61ea6c91e1a5dae1ecd93edc9ae516a1df6ab9","observation_id":"67893cbf-c80c-41c7-b2d2-f3776cc73794","resolution":{"observed_at":"2026-05-11T09:31:01.138639Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:ef29c55e4a91e250b6fecafa95518d71844fa73050134d5cd3e6c3dec9c44e98","observation_id":"5cc4aa8d-625b-4899-89a0-bb40273b0134","resolution":{"observed_at":"2026-05-12T08:58:35.940011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":"2310.06987","doi":"10.48550/arxiv.2310.06987","metadata_source":"pith","pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","venue":"cs.CL","work_id":"9fb26453-add9-48f5-8330-713e9b8726ed","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:b0e26339db09e56962ba5a5008ba1b54fe5802effd4dd35de18fd2f1c1c9bd98","observation_id":"a302b4f9-a0ef-419f-af3f-5b3279fb3f1e","resolution":{"observed_at":"2026-05-16T22:00:51.596826Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:25.810147+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:25.810147+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08487","last_updated":"2023-08-28T08:35:28Z","snapshot_observed_at":"2026-07-06T15:54:51.088869Z","submitted_at":"2023-07-17T13:49:52Z","title":"Latent Jailbreak: A Benchmark for Evaluating Text Safety and Output Robustness of Large Language Models","version":3},"cited_work":{"arxiv_id":"2307.08487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.08487","snapshot_observed_at":"2026-06-30T09:54:34.336996Z","title":"Latent jailbreak: A benchmark for evaluating text safety and output robustness of large language models","venue":null,"work_id":"275fc67e-6947-4d22-953d-478043d71c7c","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2307.08487","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:dfd1d40d86966f518d92480dae6fff99dcc5e0b057639e8cf4414210cf8ea6be","observation_id":"8bbcf1f9-cc39-4b84-866b-3b1ee981fff3","resolution":{"observed_at":"2026-05-11T09:31:01.017286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint =","venue":null,"work_id":"71236924-a266-4cc0-a504-f5dcd0e7217c","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:929c3174f159cab5b90f0b7d7228082ce8ca39d72a794eba29ec96b178c0d887","observation_id":"4f3c832a-db8e-4de2-8d4b-61621425defc","resolution":{"observed_at":"2026-05-17T17:25:00.509657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computer , volume=","venue":null,"work_id":"d0a70eb8-f47b-4a1a-a3fb-554f5173bbf5","year":2022},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:ddaa5bde7d5ba124f04643f5107ad8aaa657898a57e046f56a115d2628ebcbd1","observation_id":"dd350fd1-a586-4b59-b169-dcc003e615ff","resolution":{"observed_at":"2026-05-17T17:25:00.562450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:36:12.788904Z","title":"2025 , eprint=","venue":null,"work_id":"b1a2cc9b-8086-427e-830d-991890d05419","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:e0e8ffdc003202e372ec04bb480fdb526885bf35e48b7029991cb4a1ec3434c3","observation_id":"83f0276c-0ad2-4226-a085-e9664158827c","resolution":{"observed_at":"2026-05-17T17:25:00.616996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.773911Z","title":"2025 , eprint=","venue":null,"work_id":"1fd048bc-aa1c-449a-92ac-506d4bb23094","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:db5b9dfb8116ec796aeac86b3ecd6aaa27f59784ce014303b9fbc5fc71f03b31","observation_id":"e381182a-4d43-467b-8942-e565a580950e","resolution":{"observed_at":"2026-05-17T17:25:00.591576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , month = apr, day =","venue":null,"work_id":"dc5bc200-24ac-49d7-b1ef-375e459b149b","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:4a7c8255a2068ac848575895fd603a53b22c43f7875fae00a60c1646e7a75e8f","observation_id":"2b16e8d8-2266-476f-80e7-353915615796","resolution":{"observed_at":"2026-05-17T17:25:00.553241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03556","last_updated":"2024-12-19T22:37:45Z","snapshot_observed_at":"2026-08-11T22:13:31.714802Z","submitted_at":"2024-12-04T18:51:32Z","title":"Best-of-N Jailbreaking","version":2},"cited_work":{"arxiv_id":"2412.03556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03556","snapshot_observed_at":"2026-07-04T17:30:00.621770Z","title":"Best-of-n jailbreaking","venue":null,"work_id":"510304b6-9054-406f-bd07-365258693153","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2412.03556","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:482faa1db003e1a98632b7ae137b220069f983c1624dd0cc3a9fa4fd9c4e534a","observation_id":"5aaa337b-cf50-42b5-ae66-09c6cf565524","resolution":{"observed_at":"2026-05-11T09:31:01.204907Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , month = feb, day =","venue":null,"work_id":"fb8272b3-73ae-4b88-b6d9-32704f29594f","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:b9b5f506bd561e3c35650ad56ebf36822468ca338aca951780b42cef98045655","observation_id":"e459db5c-d7c9-402f-b794-eb4824565c12","resolution":{"observed_at":"2026-05-17T17:25:00.512822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05176","last_updated":"2025-06-11T02:54:49Z","snapshot_observed_at":"2026-08-09T13:23:52.437582Z","submitted_at":"2025-06-05T15:49:48Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","version":3},"cited_work":{"arxiv_id":"2506.05176","doi":"10.1016/j.displa.2025.103255","metadata_source":"pith","pith_arxiv_id":"2506.05176","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models","venue":"cs.CL","work_id":"bab684a8-d933-426c-a19e-2c855a0d1f59","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2506.05176","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:3b541778193f0ba1950410fedc011cf49e73243256ab8f7b8ce1d544561f96d7","observation_id":"16b7f8c6-a63b-4aaa-84e3-3a9c9df98daa","resolution":{"observed_at":"2026-05-11T09:31:01.210573Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.791332Z","title":"author=","venue":null,"work_id":"78d5b8e1-1042-4222-9246-42cfa74bf034","year":null},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:0c417e1468e06af4630e8078de16e29320114f85040e991d6e3184551a63e6ae","observation_id":"75b0a355-faa2-430b-b9f8-462641cb5333","resolution":{"observed_at":"2026-05-17T17:25:00.559341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:16:16.357374Z","title":"2024 , eprint=","venue":null,"work_id":"03076031-5b7d-4563-9dd7-21b7b28bf714","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:9376740a3ef3c297dad1b6faae1594595eb07727ca1d3668faab4a058dc4469a","observation_id":"095f2c12-a894-4ffa-94d0-3f81ba387840","resolution":{"observed_at":"2026-05-17T17:25:00.609051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-07T23:37:32.488201Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:b612e6e0cd80f818e3e148311e82b45caf4bfde486db308d173c40e3064a2b03","observation_id":"58db8de2-4657-4f0c-b486-b091a2229339","resolution":{"observed_at":"2026-05-11T09:31:00.953629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"ce12bf95-f4c2-48f3-a6da-a2e4a7390c31","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:8dbb888f27e3e3a02da7c2d479d7fdd28f1a0f7d4b35576d214274e472ab5135","observation_id":"e467c562-5fe0-4b1d-827d-bd917a361b38","resolution":{"observed_at":"2026-05-17T17:25:00.597853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:78b6d4550e4ce85ed5375e1b7c59293398239b51e42e87950f8dcfaee97c23fd","observation_id":"9b175977-93f9-46c1-aecf-86bc36f4500f","resolution":{"observed_at":"2026-05-11T09:31:01.181661Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:290c49cbe9e21d5da32275d02f18330c272570f69f16136b1c6341e36101f0d5","observation_id":"cf6f2377-d72e-441c-a573-7eeb4dc16afa","resolution":{"observed_at":"2026-05-11T09:31:01.291137Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03814","last_updated":"2025-01-07T07:46:16Z","snapshot_observed_at":"2026-08-12T22:06:35.992107Z","submitted_at":"2024-11-06T10:32:09Z","title":"MRJ-Agent: An Effective Jailbreak Agent for Multi-Round Dialogue","version":2},"cited_work":{"arxiv_id":"2411.03814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03814","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mrj-agent: An effective jailbreak agent for multi-round dialogue","venue":null,"work_id":"f6b482a6-9b3e-46e7-9f7b-64dc2fd9c4da","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2411.03814","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:7233076243ad70f2b0a9a28965be13dad5d9facc54bca2dc6e560094ed91fd11","observation_id":"81b4e7d8-23c5-4eb3-a577-99832bf8482a","resolution":{"observed_at":"2026-05-11T09:31:01.003678Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"6488f1f6-4ebd-43b8-b073-ced9ee5ecefb","year":null},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:f452146b607889b12e8ab4cffae20d78db5577ff52c9e4b9889de8f5a2da7cff","observation_id":"37728d1d-6f66-4029-9283-10849ec654a8","resolution":{"observed_at":"2026-05-17T17:25:00.577233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , howpublished =","venue":null,"work_id":"807b6e71-26e9-4130-9fb3-4e42e963d975","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:6374051c25d516d265335829ff354ed033b7d8be81cca06e45e5758811c98eb9","observation_id":"bdf4ee67-6c63-4b44-a0e6-ce72407fe6bb","resolution":{"observed_at":"2026-05-17T17:25:00.547881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.199137Z","title":"2024 , eprint=","venue":null,"work_id":"56de79bb-a384-4567-8274-19e8bfa69568","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:2c7f6d0ed24c4f5e705adb2e31f8df88ddacd18b3d250a5baff4cdeede30c35d","observation_id":"381e3394-bafc-422c-ab49-97921b793512","resolution":{"observed_at":"2026-05-17T17:25:00.581206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21605","last_updated":"2026-04-05T01:29:06Z","snapshot_observed_at":"2026-07-06T21:31:40.171357Z","submitted_at":"2025-05-27T17:47:08Z","title":"SoSBench: Benchmarking Safety Alignment on Six Scientific Domains","version":3},"cited_work":{"arxiv_id":"2505.21605","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21605","snapshot_observed_at":"2026-06-30T11:44:38.782098Z","title":"SoSBench: Benchmarking Safety Alignment on Six Scientific Domains","venue":"cs.LG","work_id":"64f46727-9b13-4c5d-8da7-84e2412729df","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2505.21605","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:558a790ff1d3ba7b37b71a72a02d8fbdd93a03223e67d15d51bc7405a3197ba4","observation_id":"7210aaf0-1365-44fa-b328-d94281f84e69","resolution":{"observed_at":"2026-05-11T09:31:01.236234Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12025","last_updated":"2025-02-17T16:57:56Z","snapshot_observed_at":"2026-08-10T22:18:09.505446Z","submitted_at":"2025-02-17T16:57:56Z","title":"SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":"2502.12025","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12025","snapshot_observed_at":"2026-07-01T08:55:35.552681Z","title":"Safechain: Safety of language models with long chain-of-thought reasoning capabilities","venue":null,"work_id":"99fb5b54-7b9b-4c81-8804-f8f01386b344","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2502.12025","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:8d25ae7598e1ef4ec9c3533cfe068af14d190e5281be9098b78657a91f5d10b0","observation_id":"4279a036-820a-4619-8e3f-e68edefdcb15","resolution":{"observed_at":"2026-05-11T09:31:01.221364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on Neural Networks and Learning Systems , volume=","venue":null,"work_id":"a20fd2cf-c0ad-466e-9ab8-9d334370c392","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:6ef2f130dd14a106092e01f04421233299f3cd2439fe59c0d0201b8845e51e3b","observation_id":"8d8d3568-fe6a-4bdb-a3be-123e29301775","resolution":{"observed_at":"2026-05-17T17:25:00.485941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.11665","last_updated":"2021-05-31T11:46:48Z","snapshot_observed_at":"2026-08-06T18:36:46.084748Z","submitted_at":"2021-01-27T19:52:24Z","title":"On Statistical Bias In Active Learning: How and When To Fix It","version":2},"cited_work":{"arxiv_id":"2101.11665","doi":"10.48550/arxiv.2101.11665","metadata_source":"pith","pith_arxiv_id":"2101.11665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On statistical bias in active learning: How and when to fix it.arXiv preprint arXiv:2101.11665","venue":"stat.ML","work_id":"c6395957-31cb-46da-993c-8dcbb4ecf63d","year":2021},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2101.11665","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:422b425d0a7bc2c7eebf72e9c6888b03b619de5a46293390c900d3d366eca3ae","observation_id":"d173da48-cc9b-478c-beb5-18c13f963ae6","resolution":{"observed_at":"2026-05-11T09:31:01.009039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-12T23:08:15.634578Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":"2408.02666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-07-04T11:39:47.080762Z","title":"Self-taught evaluators","venue":null,"work_id":"9599e5b4-f4d0-48e3-9cd8-5b366fb2ae20","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:72fe9fcf380fc07e41d99499a158b2cdcce7185bce5e6c21d9f22528acc03fed","observation_id":"b809b336-e4db-44ff-922c-99944a7e300d","resolution":{"observed_at":"2026-05-11T09:31:01.129656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"c33a2e51-8105-4080-8c85-bfe10d227581","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:155b5e881b2ebf5e4a19ee47acdf3672b873547de5da1bc7213b1d1af56cebfa","observation_id":"5e7bdbf8-685c-4fc0-8c81-62c31d660c87","resolution":{"observed_at":"2026-05-17T17:25:00.482653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:22:39.364395Z","title":"2024 , eprint=","venue":null,"work_id":"74d56e4e-a666-4d81-a515-4dcdd7a131c6","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:4c122390809d56dbcf85887137bd836c979263974a1d3f1bae4150a495c8cd51","observation_id":"37bdac1c-5d68-433f-b4cc-e622b3ea3d5a","resolution":{"observed_at":"2026-05-17T17:25:00.516652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"9c01f5de-44c9-468c-9b68-4452f830d5c9","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:5e2d05608858f1edaa1482a5da766c84c8e484550fce0320d6082b2f49d96ef2","observation_id":"2c98548d-9303-4178-8206-d60e67cb8f48","resolution":{"observed_at":"2026-05-17T17:25:00.542339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Standard Models , author=","venue":null,"work_id":"2ba22a56-c586-4d11-8ce4-9aa3312f4912","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:dd08dc6942661d5e0c71de6d857a73003f7a87b31364126c84dbc354b2b26401","observation_id":"ac8858e5-a760-4fc8-94b8-9168e07f01ec","resolution":{"observed_at":"2026-05-17T17:25:00.539508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"3032b3eb-62ef-4446-9c07-1feb157f2999","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:bd305ff1395f497c786ffe96510fee32b00c0b1140169c139046d31004173e20","observation_id":"0f7faae3-cd8f-4371-9f6b-0608d11dea79","resolution":{"observed_at":"2026-05-17T17:25:00.492226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T19:36:29.930966Z","title":"2023 , eprint=","venue":null,"work_id":"8222462c-c885-414a-9965-ea8425278550","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:b9de578a035b0bc442241cb127bafcdfdb755945e46c0f6462a78076c9210eed","observation_id":"358e08b6-e893-47d9-9bb2-f82c6c91c74f","resolution":{"observed_at":"2026-05-17T17:25:00.489172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:11:52.084044Z","title":"2024 , eprint=","venue":null,"work_id":"14fb1c27-d491-42ad-b50b-3c1f3a471959","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:9ea626f63b49e5f02734dbe7c3059611b7433ade07bb48670f89426a761d1db6","observation_id":"2df1776f-2fd1-4471-819d-998a7098d14f","resolution":{"observed_at":"2026-05-17T17:25:00.536562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous Judgment Tasks , author=","venue":null,"work_id":"786f0329-7f06-4cfa-8684-e23c11a54053","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:b2dd962b2ffe847f6aa69212bce65afe06899022085d913c6c3deefcda3218cc","observation_id":"885bfa4b-ea8a-4a04-81a8-751462a3e0fc","resolution":{"observed_at":"2026-05-17T17:25:00.602041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"e3d0aeac-1b25-4c59-972b-ea23ab3c92f0","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:4a87ee81666f80946384c699ebfd21019a1c178d56586e88a9a75fad54979827","observation_id":"858fa60d-121f-4e21-b07b-976acde966e2","resolution":{"observed_at":"2026-05-17T17:25:00.545173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"a9c51124-909e-4e3e-b40b-1e0d69c8b1ef","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:19aaabcd7ce05f108ce68bc1d37f10ea0da6f800381681bbece1770a7a53029e","observation_id":"7ac2853b-77b7-4c43-b562-1fdf5c0d71a5","resolution":{"observed_at":"2026-05-17T17:25:00.530100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"22bcc7ea-17e3-493b-991f-bff460118824","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:c3feae6b4aa78bb12a25a2ac2a2bf4efc0046b23f883b81779c440c60090ea57","observation_id":"335ec422-e60e-4221-b583-cddfc5eae1c8","resolution":{"observed_at":"2026-05-17T17:25:00.498805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.787207Z","title":"2025 , eprint=","venue":null,"work_id":"4aa9c0aa-ba45-40b1-b385-3024db0e8a6f","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:94a1774c7c089881d93f6fc7db2cf31d8fad61bea59f8692438af1300fff1498","observation_id":"134c2e54-2d36-4e10-9bad-97879483cc8c","resolution":{"observed_at":"2026-05-17T17:25:00.502712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , url =","venue":null,"work_id":"7c363d90-eacf-4a07-bcf3-10f1dbabf418","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:fff1674daa7a8f7b2f14c6430517996ba5fd4352eae0271578bd33420f029e9a","observation_id":"d472260b-92f9-4496-8d5b-13acd40cad6c","resolution":{"observed_at":"2026-05-17T17:25:00.533135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"11af042d-6a6a-489e-9608-119eb98fa8f6","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:408be325e5e3933187f40e89ac39777c37ba0d2050673e3570d499bb54364b1b","observation_id":"8d8e083d-a766-49e0-bd6b-d980fc77c9da","resolution":{"observed_at":"2026-05-17T17:25:00.613001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , url =","venue":null,"work_id":"5005de01-a27e-4863-b4e7-4cda89076fe8","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:9805b1754ee2ebaa7cbd9bb8dc45db089cdab0ccf0ad5098958386507af2ce69","observation_id":"346158e7-c21e-4343-92e1-3b5246e5ebc9","resolution":{"observed_at":"2026-05-17T17:25:00.550605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , howpublished =","venue":null,"work_id":"f28dd7ee-156b-47fb-aeb7-380e9d6cdc52","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:201a45ad83a1d566911dd76b7bc9941df0df7c2e51751de7052f3559fdca71fd","observation_id":"fcc5ba13-c697-44ff-adba-f3fc6cf884e4","resolution":{"observed_at":"2026-05-17T17:25:00.565358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"4ecf9298-d57a-401f-8da3-f0aae4d6d99e","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:13199e08b6d6f2c4c757636884600927165407a7d76c1b20abde2e595ff494d4","observation_id":"2f294101-b005-4cdd-b3ea-149c0c3dc72d","resolution":{"observed_at":"2026-05-17T17:25:00.574362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"fd407613-758c-4387-886a-6645d5b31216","year":2023},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:a2c0aa5249795930d409f7720877f05cbca96056ab5a73a0063f3f03800afcff","observation_id":"14468d95-2a9d-4946-8b71-0bd01fc3ecb4","resolution":{"observed_at":"2026-05-17T17:25:00.620546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.106824Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"bbd406a3-5c71-400c-8be6-a6512f5ba309","year":null},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:9817efd2d60bbd8a788ea1feb686966755c7076b3322493f06d8a6620b334e29","observation_id":"b23637f1-ef7d-4a3c-a06f-cfd6d7aa7bcc","resolution":{"observed_at":"2026-05-17T17:25:00.571482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Educ Psychol Meas , volume=","venue":null,"work_id":"218fd9d1-b026-4fd1-b80c-40865bbbb4c9","year":null},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:720820f1c962d4e9c13f5219251314503ffdc82f2ccd0ebd96a4aa70c45b491d","observation_id":"06be3a5d-de18-4a8c-abfd-6c8757d6969e","resolution":{"observed_at":"2026-05-17T17:25:00.605630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.09990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T23:06:20.846590Z","title":"& Shao, J","venue":null,"work_id":"c8dcf8e3-a541-4117-be5b-665d0bb8826d","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:ca484db4446eaa47f39c5b73f3a0e136dc2138c28ed2eaa435ae9fdadd4d4daa","observation_id":"8eadd351-68b8-4279-bc13-23c1a31946e5","resolution":{"observed_at":"2026-05-11T09:31:01.052993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.00187","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Steering dialogue dynamics for robust- ness against multi-turn jailbreaking attacks.arXiv preprint arXiv:2503.00187","venue":null,"work_id":"b6759021-9a42-4bf6-95c6-e8dc04706010","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:56ea9a22c3e1afaa8172e8817f357cd34c752e6012c77874bdf5f16ea584200e","observation_id":"30079e97-6687-405e-b831-e22a2b7b2820","resolution":{"observed_at":"2026-05-11T09:31:01.073795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13203","last_updated":"2025-08-23T02:09:57Z","snapshot_observed_at":"2026-08-11T11:02:05.829392Z","submitted_at":"2025-04-15T16:11:28Z","title":"X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents","version":2},"cited_work":{"arxiv_id":"2504.13203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13203","snapshot_observed_at":"2026-07-03T06:07:41.476618Z","title":"X-teaming: Multi- turn jailbreaks and defenses with adaptive multi-agents","venue":null,"work_id":"14895b6e-e521-434c-b30f-db8fcc0f1232","year":2026},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2504.13203","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:af169f0580efc4dd1a406075dd94f2a27345321ccaf8acce75369c3f85132154","observation_id":"2bf7f2eb-20c9-4b4a-8778-8363e4058464","resolution":{"observed_at":"2026-05-11T09:31:01.098291Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , publisher=","venue":null,"work_id":"39bca741-d3a3-4a31-9ae9-dab49f6e26dc","year":2026},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:cf6c943c39ba50e2fabf8de6f73e555fd310ab6b457ab9015e337087a1593caf","observation_id":"d5ab5270-0b75-4bc3-8b4a-e7016fd8327e","resolution":{"observed_at":"2026-05-17T17:25:00.594614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0dd9041a-bc31-48cf-a380-2ff1e0cb1b7d","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:5fdcc7e1238db3b7906a06dabf1371ed8a77a3e98d6e4f5f6a5e333a34840cdb","observation_id":"dff50217-3abb-4fc2-b9dc-b41f6d626a53","resolution":{"observed_at":"2026-05-17T17:25:00.519929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 IEEE symposium on security and privacy (SP) , pages=","venue":null,"work_id":"0b3d0229-dbcb-40c1-af46-1a212cc801b1","year":2019},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:9d32ddfa0cc5dbba0e2f1638d2012c81bfb2b9bb60b340d5110b38f3473edade","observation_id":"e7c8572c-03e7-4f97-8a32-de928a2428ea","resolution":{"observed_at":"2026-05-17T17:25:00.476028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06472","last_updated":"2019-05-29T03:06:52Z","snapshot_observed_at":"2026-07-06T07:45:50.136936Z","submitted_at":"2019-04-13T02:59:48Z","title":"A Repository of Conversational Datasets","version":2},"cited_work":{"arxiv_id":"1904.06472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.06472","snapshot_observed_at":"2026-07-04T23:40:06.189886Z","title":"arXiv preprint arXiv:1904.06472 , year=","venue":null,"work_id":"fa02d40e-6187-4c54-af42-d72859f37315","year":1904},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/1904.06472","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:a1ac52717793f4e2e5a8f57e6d44ffd8b82cbc2cba9718c1f2149b4a36957470","observation_id":"8f69c2c3-9436-4e3c-8481-401af6484992","resolution":{"observed_at":"2026-07-04T23:40:06.189886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:abf5c49a3e6cd5016585dfc317133050ae0cdc45d5b74402b80ca5e37ac9343c","observation_id":"91f98b2d-f620-4f93-98d4-8a539eddfc09","resolution":{"observed_at":"2026-05-11T09:31:01.107243Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14276","last_updated":"2025-10-16T04:00:18Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-16T04:00:18Z","title":"Qwen3Guard Technical Report","version":1},"cited_work":{"arxiv_id":"2510.14276","doi":"10.48550/arxiv.2510.14276","metadata_source":"pith","pith_arxiv_id":"2510.14276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3Guard Technical Report","venue":"cs.CL","work_id":"de1c5964-d29a-456c-97cc-30684b243a85","year":2025},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2510.14276","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:c8b826c437718a8885919760081f916a89af2a391100bc889ea53287ac0d74ca","observation_id":"741ebe01-1101-4823-9dcf-8eb789514f8f","resolution":{"observed_at":"2026-05-13T22:33:37.835217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sema: Simple yet effective learning for multi-turn jailbreak attacks","venue":null,"work_id":"af92cf4a-1110-49e8-a2b7-7e7c23733085","year":2026},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:b4a41f8bf6c352cf8677aa3625df24fca5951dd459ddfadf32ba66b98aaa97f2","observation_id":"42caccb8-ce6d-4cb4-8c1b-9219d9579b58","resolution":{"observed_at":"2026-05-11T09:31:01.043904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint =","venue":null,"work_id":"67b4b2e2-6b8e-4bd1-996b-60fa3ccbdaaf","year":2026},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:ffa2d0ca259c98fa1f50a00565587a2de2cd971650172356f0bfe90d68cad048","observation_id":"280d419c-2947-4a17-a985-2c2a8e3ae704","resolution":{"observed_at":"2026-05-17T17:25:00.505825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":25,"parse_uncertain":0,"unresolved":1,"verified_exact":7,"verified_fuzzy":44},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 7 inbound Pith citation observations for arXiv:2605.01687."}